Infraestrutura, nuvem e DevOps · Misto

Revisão de incidente sem busca de culpados

Em uma linha: Depois de cada incidente, uma hora de revisão escrita focada no sistema e não na pessoa vale a pena — senão o mesmo incidente volta.

Durante o incidente

Um gerente de incidente que decide e documenta, um único canal de comunicação e atualização dos clientes o mais cedo possível. A recuperação precede a investigação: restaure o serviço e colete evidências ao longo do caminho.

Depois

Escreva uma linha do tempo factual, o impacto em números, o que atrasou a detecção e o que atrasou a correção. Os dois últimos são os importantes — o tempo de detecção costuma ser maior que o de correção, e isso aponta para lacunas de monitoramento.

Produza duas ou três ações com um dono e uma data. Vinte ações significam zero ações.

Cultura

Quem apertou o botão é o sintoma; o sistema que permitiu sem aprovação, sem verificação e sem volta é o problema. Times que caçam culpados aprendem a esconder incidentes, o que é muito mais perigoso.

Indo mais fundo

Mantenha as revisões em um lugar acessível e leia-as trimestralmente. Padrões recorrentes — a mesma dependência, o mesmo tipo de mudança, a mesma hora da semana — apontam para um problema estrutural que nenhuma revisão isolada revela.