Résilience et haute disponibilité

L'infrastructure de CrowdHandler est conçue pour garantir une disponibilité et un temps de fonctionnement continus. Nous utilisons les mécanismes de résilience et de tolérance aux pannes suivants :

de disponibilité AWS#

Nous utilisons plusieurs zones de disponibilité dans chaque région AWS afin d'assurer une redondance au niveau du centre de données. Cela permet de se prémunir contre les pannes susceptibles d'affecter l'ensemble d'une zone.

de bases de données Multi-AZ#

Nos bases de données MySQL RDS sont déployées en mode multi-AZ sur trois zones de disponibilité. Cela permet une réplication synchrone des données avec basculement automatique en cas de défaillance d'une instance de base de données ou de perturbation dans une zone de disponibilité.

entre régions AWS#

Nous reproduisons l'intégralité de l'infrastructure et des données de notre région principale US-East-1 vers la région US-East-2. Cela comprend :

  • Instantanés de bases de données — Nous effectuons toutes les heures des instantanés des bases de données de production, qui sont ensuite répliqués vers la région US-East-2. Nous pouvons ainsi effectuer une restauration à partir d'un instantané en cas de sinistre touchant l'ensemble de la région.
  • Réplication des compartiments S3 - Toutes les données contenues dans les compartiments S3 de production sont répliquées de manière asynchrone vers les compartiments US-East-2.
  • Sauvegardes AMI – Les images des serveurs EC2 (le cas échéant) sont sauvegardées dans la zone US-East-2 au cas où nous aurions besoin de lancer des serveurs de remplacement.
  • Contrôles d'intégrité Route53 — Nous utilisons les contrôles d'intégrité Route53 pour surveiller les terminaux situés à la fois dans les zones US-East-1 et US-East-2. Le trafic peut être rapidement redirigé vers la région secondaire si nécessaire.

de reprise après sinistre#

Nous effectuons chaque année des tests de reprise après sinistre afin de nous assurer que nous sommes en mesure de rediriger l'ensemble du trafic et de basculer vers la zone US-East-2 en cas de panne majeure dans la zone US-East-1. Ces tests comprennent :

  1. Simulation d'une panne dans la zone US-East-1 nécessitant un basculement
  2. Promotion des bases de données de secours dans la région US-East-2 pour qu'elles deviennent des bases de données principales
  3. Mise à jour des serveurs DNS ou des origines d'application pour acheminer tout le trafic vers la zone US-East-2
  4. Réalisation de tests visant à valider la disponibilité des applications et l'accès aux bases de données
  5. Revenir à la zone US-East-1 une fois les tests terminés

Les mesures de résilience de CrowdHandler offrent une protection contre les défaillances d'infrastructure, les perturbations logicielles et les pannes régionales. Grâce à des systèmes tolérants aux pannes, à la réplication des données entre les régions et à des tests réguliers de reprise après sinistre, nous sommes convaincus de notre capacité à rétablir les services avec un temps d'indisponibilité minimal, même après des événements catastrophiques. Notre architecture de disponibilité est conçue pour garantir une disponibilité continue et une expérience client fluide.