Infrastruktur, Cloud & DevOps · Fortgeschritten

Hohe Verfügbarkeit und Katastrophenwiederherstellung

In einem Satz: Entscheiden Sie, wie viel eine Stunde Ausfallzeit Sie kostet, und erst dann, wie viel Redundanz Sie kaufen.

Ein Ziel vor einer Lösung festlegen

Der Abstand zwischen 99,9 und 99,99 Prozent Verfügbarkeit ist ein Abstand des Mehrfachen in Kosten und Komplexität. Die meisten Geschäftssysteme brauchen das höhere nicht, und wer es braucht, kann es in Geld begründen.

Schichten der Widerstandsfähigkeit

Mehrere Instanzen über Verfügbarkeitszonen; eine Datenbank mit einem sekundären Replikat und automatischem Failover; keine Abhängigkeit von lokalem Zustand; und Gesundheitsprüfungen, die eine fehlerhafte Instanz aus dem Verkehr ziehen.

Für den nächsten Schritt — eine zweite geografische Region — sind Kosten und Komplexität erheblich, einschließlich Fragen von Latenz und Datenkonsistenz.

Das Katastrophenszenario

Nicht nur ein gefallener Server: versehentliche Löschung, Datenverfälschung und ein gesperrtes Cloud-Konto. Jedes erfordert eine andere Antwort, und alle drei sollten einen geschriebenen Plan haben, den jemand im vergangenen Jahr las.

Im Detail

Führen Sie kontrollierte Ausfallübungen durch: Bringen Sie eine Instanz zu Fall, trennen Sie eine Abhängigkeit, füllen Sie eine Platte — in einer kontrollierten Umgebung zu bekannter Zeit. Ein nie unter Ausfall getestetes System ist nicht widerstandsfähig, es ist nur ungetestet.