Infrastructure, cloud et DevOps · Mixte

Revue d'incident sans recherche de coupables

En une ligne : Après chaque incident, une heure de revue écrite centrée sur le système et non la personne en vaut la peine — sinon le même incident reviendra.

Pendant l'incident

Un gestionnaire d'incident qui décide et documente, un seul canal de communication et une mise à jour des clients aussi tôt que possible. La restauration précède l'enquête : rétablir le service et collecter des preuves en cours de route.

Après

Rédigez une chronologie factuelle, l'impact en chiffres, ce qui a retardé la détection et ce qui a retardé la correction. Les deux derniers sont les plus importants — le temps de détection est généralement plus long que le temps de correction, et cela pointe vers des lacunes de surveillance.

Produisez deux ou trois actions avec un propriétaire et une date. Vingt actions signifient zéro action.

Culture

Celui qui a appuyé sur le bouton est le symptôme ; le système qui l'a permis sans approbation, sans vérification et sans retour en arrière est le problème. Les équipes qui cherchent des coupables apprennent à cacher les incidents, ce qui est bien plus dangereux.

Pour aller plus loin

Conservez les revues dans un endroit accessible et lisez-les trimestriellement. Les schémas récurrents — la même dépendance, le même type de changement, la même heure de la semaine — pointent vers un problème structurel qu'aucune revue isolée ne révèle.