Infraestrutura, nuvem e DevOps · Avançado

Alta disponibilidade e recuperação de desastres

Em uma linha: Decida quanto custa uma hora de inatividade e só então decida quanta redundância comprar.

Definir um objetivo antes de uma solução

A diferença entre 99,9% e 99,99% de disponibilidade é um multiplicador em custo e complexidade. A maioria dos sistemas de negócio não precisa do mais alto, e quem precisa consegue justificar em dinheiro.

Camadas de resiliência

Várias instâncias em diferentes zonas de disponibilidade; banco de dados com uma réplica secundária e failover automático; sem dependência de estado local; e health checks que removem uma instância com falha do tráfego.

Para o próximo passo — uma segunda região geográfica — o custo e a complexidade são significativos, incluindo questões de latência e consistência de dados.

O cenário de desastre

Não só um servidor caído: exclusão acidental, corrupção de dados e uma conta de cloud bloqueada. Cada um exige uma resposta diferente, e os três devem ter um plano escrito que alguém leu no último ano.

Indo mais fundo

Execute simulacros de falha controlada: derrube uma instância, corte uma dependência, encha um disco — em um ambiente controlado em um horário conhecido. Um sistema nunca testado em falha não é resiliente, apenas não testado.