Infrastruktur, Cloud & DevOps · Gemischt

Vorfalluntersuchung ohne Schuldsuche

In einem Satz: Nach jedem Vorfall lohnt sich eine Stunde schriftlicher Untersuchung, die sich auf das System und nicht die Person konzentriert — sonst kehrt derselbe Vorfall wieder.

Während des Vorfalls

Ein Vorfallmanager, der entscheidet und dokumentiert, ein einziger Kommunikationskanal und das Aktualisieren der Kunden so früh wie möglich. Die Wiederherstellung geht der Untersuchung voran: Dienst wiederherstellen und dabei Beweise sammeln.

Danach

Schreiben Sie eine sachliche Zeitleiste, die Auswirkung in Zahlen, was die Erkennung und was die Behebung verzögerte. Die letzten beiden sind die wichtigen — die Erkennungszeit ist meist länger als die Behebungszeit, und das weist auf Überwachungslücken.

Erzeugen Sie zwei oder drei Aktionen mit Eigentümer und Datum. Zwanzig Aktionen bedeuten null Aktionen.

Kultur

Wer den Knopf drückte, ist das Symptom; das System, das es ohne Freigabe, ohne Prüfung und ohne Rückweg erlaubte, ist das Problem. Teams, die Schuld suchen, lernen, Vorfälle zu verbergen, was weit gefährlicher ist.

Im Detail

Halten Sie die Untersuchungen an einem zugänglichen Ort und lesen Sie sie vierteljährlich. Wiederkehrende Muster — dieselbe Abhängigkeit, dieselbe Art Änderung, dieselbe Wochenstunde — weisen auf ein strukturelles Problem, das keine einzelne Untersuchung offenbart.