Haute disponibilité et reprise après sinistre
Définir un objectif avant une solution
L'écart entre 99,9 et 99,99 % de disponibilité est un multiplicateur en coût et complexité. La plupart des systèmes commerciaux n'ont pas besoin du plus élevé, et qui en a besoin peut le justifier en argent.
Des couches de résilience
Plusieurs instances dans des zones de disponibilité distinctes ; une base de données avec un réplica secondaire et un basculement automatique ; pas de dépendance à l'état local ; et des vérifications de santé qui retirent du trafic une instance défectueuse.
Pour l'étape suivante — une seconde région géographique — le coût et la complexité sont significatifs, incluant des questions de latence et de cohérence des données.
Le scénario catastrophe
Pas seulement un serveur tombé : une suppression accidentelle, la corruption des données et un compte cloud verrouillé. Chacun exige une réponse différente, et les trois devraient avoir un plan écrit que quelqu'un a lu dans l'année écoulée.
Pour aller plus loin
Effectuez des exercices de panne contrôlés : faites tomber une instance, coupez une dépendance, remplissez un disque — dans un environnement contrôlé et à un moment connu. Un système jamais testé en situation de panne n'est pas résilient, il est juste non testé.