基础设施、云与 DevOps · 进阶
备份与恢复:没被测试过的就等于不存在
一句话: 备份不是策略;策略是「你能丢多少数据、能停多久」——以及你确实做到了的证据。
两个数字
能往回丢多少数据,以及恢复能花多长时间。这两个都要和业务方一起定,而不是由基础设施团队定,因为它们是关于风险和成本的决策。
健康的备份是什么样
自动、加密、在多个位置有副本,并且在那个可能连同系统一起被删除的账号之外。用和生产相同的权限就能访问的备份,防不住恶意删除。
还要包括那些会被忘掉的:配置、密钥、文件存储和仪表盘。
恢复演练
每季度一次,恢复到一个独立环境,度量花了多久、缺了什么。几乎总会冒出点什么——一个权限、一个顺序、一个依赖。在演练里发现要好得多。
深入一层
把备份和归档分开:备份是为了快速恢复,归档是为了满足义务的长期留存。软删除在人为失误面前价值极大——大多数数据丢失不是基础设施灾难,而是一个疲惫的人打错了一条命令。