基础设施、云与 DevOps · 综合

不找罪魁祸首的故障复盘

一句话: 每次故障之后,花一小时写一份聚焦系统而非个人的复盘是值得的——否则同样的故障会再来一次。

故障期间

一个负责决策并做记录的故障指挥、一条统一的沟通渠道,以及尽早向客户通报。恢复优先于调查:先把服务救回来,顺路收集证据。

之后

写一条事实性的时间线、用数字表示的影响、什么拖慢了发现、什么拖慢了修复。后两项才是重点——发现所花的时间通常长于修复时间,而这指向监控的缺口。

产出两到三条行动项,带负责人和日期。二十条行动项等于零条行动项。

文化

按下按钮的那个人是症状;那个允许在没有审批、没有校验、没有回退路径的情况下按下按钮的系统才是问题。追查责任人的团队会学会隐瞒故障,而那危险得多。

深入一层

把复盘放在所有人都能访问的地方,并每季度通读一遍。重复出现的模式——同一个依赖、同一类改动、一周中的同一个时段——指向的是任何单次复盘都揭示不了的结构性问题。