基础设施、云与 DevOps · 进阶

备份与恢复:没被测试过的就等于不存在

一句话: 备份不是策略;策略是「你能丢多少数据、能停多久」——以及你确实做到了的证据。

两个数字

能往回丢多少数据,以及恢复能花多长时间。这两个都要和业务方一起定,而不是由基础设施团队定,因为它们是关于风险和成本的决策。

健康的备份是什么样

自动、加密、在多个位置有副本,并且在那个可能连同系统一起被删除的账号之外。用和生产相同的权限就能访问的备份,防不住恶意删除。

还要包括那些会被忘掉的:配置、密钥、文件存储和仪表盘。

恢复演练

每季度一次,恢复到一个独立环境,度量花了多久、缺了什么。几乎总会冒出点什么——一个权限、一个顺序、一个依赖。在演练里发现要好得多。

深入一层

把备份和归档分开:备份是为了快速恢复,归档是为了满足义务的长期留存。软删除在人为失误面前价值极大——大多数数据丢失不是基础设施灾难,而是一个疲惫的人打错了一条命令。