Eine Backup-Konsole mit einer langen Reihe grüner Häkchen beweist, dass Daten irgendwohin geschrieben wurden. Sie beweist nicht, dass die Daten zurückgelesen werden können, dass eine Anwendung daraus starten kann oder dass die gesamte Übung in das Wiederherstellungsfenster passt, das dem Unternehmen zugesagt wurde.
Ransomware hat die Form des Problems verändert. Eine Wiederherstellung bedeutete früher, einen Server oder einen gelöschten Ordner zurückzuholen. Heute bedeutet sie oft, eine ganze Stufe von Systemen gleichzeitig zurückzuholen, in eine Umgebung, der nicht vertraut werden kann, während die Personen, die die Infrastruktur am besten kennen, aus ihren gewohnten Werkzeugen ausgesperrt sind.
Dieser Artikel beschreibt ein praxistaugliches Programm für Wiederherstellungstests: drei Teststufen, eine Startfrequenz für jede, die Messgrößen, die die Wiederherstellungszeit tatsächlich vorhersagen, wie Ergebnisse gegen RTO und RPO dokumentiert werden und woran Übungen am häufigsten scheitern.
Wiederherstellungstests sind der bewusste Vorgang, Daten oder Systeme aus dem Backup an einen kontrollierten Ort zurückzuspielen und zu bestätigen, dass das Ergebnis vollständig, konsistent und nutzbar ist. Sie unterscheiden sich vom Monitoring der Backup-Jobs, das nur meldet, dass die Schreibphase abgeschlossen wurde, und von automatisierten Verifizierungsfunktionen, die einen Snapshot booten oder Prüfsummen vergleichen. Das sind Plausibilitätsprüfungen einer Kopie, keine Probe des Prozesses, dem ein Team unter Druck folgen würde.
Die Wiederherstellungszeit wird von Dingen bestimmt, die ein Backup-Job nie beansprucht: dem Durchsatz des Wiederherstellungspfads, der Reihenfolge, in der abhängige Systeme zurückkommen müssen, der Verfügbarkeit von Zugangsdaten und DNS und der Zeit, die Menschen für Entscheidungen brauchen. Eine Restore-Übung misst all das.
Ein funktionierendes Programm testet kleine Dinge oft, mittlere Dinge regelmäßig und große Dinge selten, aber ernsthaft.
Der leichteste Test stellt eine einzelne Datei, ein Postfachelement, eine Datenbanktabelle oder ein S3-Objekt aus einem zufällig gewählten Backup-Zeitpunkt wieder her und vergleicht es mit einer bekannten Referenz. Ziel ist die Integrität des Katalogs: Weiß die Backup-Anwendung, wo die Daten liegen, kann sie sie abrufen, und stimmt der Inhalt überein. Diese Prüfungen sind günstig und lassen sich automatisieren. Sie sollten über Workloads und Backup-Alter rotieren, damit auch ältere Wiederherstellungspunkte, einschließlich derer in einer unveränderlichen Stufe, geprüft werden.
Die mittlere Stufe stellt eine vollständige Anwendung wieder her, typischerweise eine Datenbank, einen Dateiserver oder ein Geschäftssystem mit seinen Abhängigkeiten, in ein isoliertes Netzsegment. Erfolg heißt nicht, dass die virtuellen Maschinen hochfahren. Erfolg heißt, dass der Anwendungsverantwortliche sich anmeldet, einen vereinbarten Satz von Validierungsabfragen oder Transaktionen ausführt und abnimmt. Hier treten latente Probleme zutage, etwa eine wiederhergestellte Datenbank, die bootet, aber ihre Authentifizierungsquelle nicht erreicht.
Der schwerste Test stellt eine gesamte Stufe von Systemen parallel in einen Clean Room wieder her, eine isolierte Wiederherstellungsumgebung: eine frisch aufgebaute, isolierte Umgebung mit eigener Identität, eigenem Netz und eigenen Managementwerkzeugen, von der angenommen wird, dass kein Angreifer darin präsent ist. Es ist der einzige Test, der den aggregierten Wiederherstellungsdurchsatz unter realistischer Last misst, Reihenfolgeprobleme zwischen Systemen offenlegt und den Incident-Response-Plan probt. Er sollte als Übung mit Szenario, Protokollführer und Nachbesprechung durchgeführt werden.
Die Frequenz sollte der Kritikalität des Workloads und den Kosten des Tests folgen und anhand von Erkenntnissen angepasst werden. Deckt eine Probe der Stufe 3 eine Abhängigkeit auf, die niemand dokumentiert hat, sollte die nächste früher stattfinden.
Regulierte Organisationen haben möglicherweise vorgeschriebene Mindestanforderungen. Die obigen Frequenzen sind kein Standard, sondern nur ein vertretbarer Ausgangspunkt.
Eine Übung, die mit „es hat funktioniert“ endet, hat den größten Teil ihres Wertes verschenkt. Fünf Messgrößen machen aus einem Test Daten, die sich mit den vereinbarten Wiederherstellungszielen vergleichen lassen.
Gemessen in Terabyte pro Stunde über den gesamten Wiederherstellungspfad, nicht der Spitzenwert eines einzelnen Streams. Angenommen, eine Organisation hat 200 TB in ihren Tier-1-Systemen und ein festgelegtes RTO von 24 Stunden. Sie braucht eine anhaltende Rate von über rund 8,5 TB pro Stunde, mit Reserve, sonst ist das RTO Fiktion, unabhängig davon, wie gut die Backups erstellt wurden.
Verstrichene Zeit von der Entscheidung zur Wiederherstellung bis zur Validierung des ersten Tier-1-Systems. Dies erfasst den fixen Overhead für den Aufbau des Clean Rooms und die Wiederherstellung der Identität, den keine Durchsatzzahl zeigt.
Verstrichene Zeit, bis das letzte System der Stufe die Validierung bestanden hat. Dies ist das Hauptergebnis einer Übung der Stufe 3.
Der Prozentsatz der wiederhergestellten Elemente, die die Validierung im ersten Versuch bestanden haben. Alles unter 100 Prozent ist ein Befund.
Die Object-Lock-Aufbewahrung sollte getestet, nicht angenommen werden. Ein Operator mit einer standardmäßigen, nicht-administrativen Identität versucht, einen gesperrten Wiederherstellungspunkt zu löschen oder zu überschreiben, und protokolliert die Verweigerung. Derselbe Versuch sollte mit dem Dienstkonto der Backup-Anwendung selbst unternommen werden, da dies die Zugangsdaten sind, die ein Angreifer am wahrscheinlichsten erlangt. Gelingt einer der beiden Versuche, sind die Backups nicht geschützt.
| Teststufe | Umfang | Startfrequenz | Zentrale Kennzahlen | Verantwortlich |
|---|---|---|---|---|
| Stufe 1: Stichprobe | Einzelne Datei, einzelnes Objekt oder einzelne Tabelle aus rotierenden Backup-Zeitpunkten und -Altern | Wöchentlich (Tier 1), monatlich (Tier 2), quartalsweise (Tier 3); automatisiert | Erfolgsquote; Abrufzeit; protokollierte Verweigerung durch Unveränderlichkeit | Backup-Administrator |
| Stufe 2: Anwendungswiederherstellung | Eine Anwendung mit Abhängigkeiten, isoliertes Segment, Validierung durch Verantwortlichen | Quartalsweise (Tier 1), halbjährlich (Tier 2), jährlich (Tier 3) | Zeit bis zur validierten Anwendung; Erfolgsquote; fehlende Abhängigkeiten | Backup-Administrator mit Abnahme durch Anwendungsverantwortlichen |
| Stufe 3: Probe der Massenwiederherstellung | Gesamte Stufe parallel in einen Clean Room, als Szenario mit Nachbesprechung | Jährlich und nach größeren Infrastrukturänderungen | Anhaltender Durchsatz; Zeit bis zum ersten nutzbaren System; Zeit bis zur vollständigen Stufe | Infrastrukturleitung mit Sicherheit und Business Continuity |
Jede Übung sollte ein kurzes Protokoll hervorbringen, das ein Nichtspezialist sechs Monate später lesen kann: Datum, Szenario, betroffene Systeme, der gewählte Wiederherstellungspunkt und sein Alter (das erreichte RPO für diesen Test), die oben genannten verstrichenen Zeiten (das erreichte RTO), Erfolgsquote, Ergebnis der Unveränderlichkeitsprüfung und jeder Befund mit Verantwortlichem und Fälligkeitsdatum.
Der nützliche Vergleich ist erreicht gegen vereinbart. Eine Tier-1-Anwendung mit einem RTO von 4 Stunden, deren Validierung 7 Stunden dauerte, ist eine dokumentierte Lücke: Entweder ändert sich das RTO, die Infrastruktur ändert sich, oder das Unternehmen akzeptiert das Risiko schriftlich. Die Nachverfolgung der Ergebnisse über mehrere Übungen zeigt auch, ob der Wiederherstellungsdurchsatz mit dem Datenwachstum Schritt hält; der frühere Beitrag zur Dimensionierung von Backup-Repositorys behandelt die Kapazitätsseite.
Die technische Wiederherstellung der Daten ist selten der Teil, der versagt. Die wiederkehrenden Ursachen sind:
Scality ARTESCA ist S3-Objektspeicher, der als Backup-Ziel konzipiert ist, mit Unveränderlichkeit durch S3 Object Lock, die vom Speicher und nicht von der Backup-Anwendung durchgesetzt wird. Da die unveränderlichen Kopien online sind und nicht auf Wechselmedien oder in einem Offline-Tresor liegen, können sie als Wiederherstellungspunkte ausgewählt und direkt über die Backup-Anwendung zurückgelesen werden, was Tests der Stufen 1 und 2 gegen geschützte Kopien zu einem Routinevorgang macht.
ARTESCA ist mit den wichtigsten Backup-Anwendungen validiert, sodass Übungen dieselbe Konsole, denselben Katalog und dieselben Workflows nutzen, die Operatoren bereits kennen. Die oben beschriebene Unveränderlichkeitsprüfung kann als einfacher S3-Löschversuch gegen ein gesperrtes Objekt durchgeführt werden, wobei die Verweigerung als Nachweis protokolliert wird. Die Seite zu Sicherheit und Cyber-Resilienz beschreibt die Kontrollen im Detail.
Die praktische Schlussfolgerung: Planen Sie in diesem Quartal die erste Wiederherstellung der Stufe 2, messen Sie die fünf Zahlen und halten Sie die Lücke zwischen dem Erreichten und dem Zugesagten schriftlich fest.