Résilience et haute disponibilité

L'infrastructure de CrowdHandler est conçue pour garantir une disponibilité et un temps de fonctionnement continus. Nous utilisons les mécanismes de résilience et de tolérance aux pannes suivants :

AWS Availability Zones

We use multiple availability zones in each AWS region to provide redundancy at the data center level. This protects against failures that could impact an entire zone.

Database Multi-AZ Deployments

Nos bases de données MySQL RDS sont déployées en mode multi-AZ sur trois zones de disponibilité. Cela permet une réplication synchrone des données avec basculement automatique en cas de défaillance d'une instance de base de données ou de perturbation dans une zone de disponibilité.

AWS Region Replication

Nous reproduisons l'intégralité de l'infrastructure et des données de notre région principale US-East-1 vers la région US-East-2. Cela comprend :

  • Instantanés de bases de données — Nous effectuons toutes les heures des instantanés des bases de données de production, qui sont ensuite répliqués vers la région US-East-2. Nous pouvons ainsi effectuer une restauration à partir d'un instantané en cas de sinistre touchant l'ensemble de la région.
  • Réplication des compartiments S3 - Toutes les données contenues dans les compartiments S3 de production sont répliquées de manière asynchrone vers les compartiments US-East-2.
  • Sauvegardes AMI – Les images des serveurs EC2 (le cas échéant) sont sauvegardées dans la zone US-East-2 au cas où nous aurions besoin de lancer des serveurs de remplacement.
  • Contrôles d'intégrité Route53 — Nous utilisons les contrôles d'intégrité Route53 pour surveiller les terminaux situés à la fois dans les zones US-East-1 et US-East-2. Le trafic peut être rapidement redirigé vers la région secondaire si nécessaire.

Disaster Recovery Testing

Nous effectuons chaque année des tests de reprise après sinistre afin de nous assurer que nous sommes en mesure de rediriger l'ensemble du trafic et de basculer vers la zone US-East-2 en cas de panne majeure dans la zone US-East-1. Ces tests comprennent :

  1. Simulation d'une panne dans la zone US-East-1 nécessitant un basculement
  2. Promotion des bases de données de secours dans la région US-East-2 pour qu'elles deviennent des bases de données principales
  3. Mise à jour des serveurs DNS ou des origines d'application pour acheminer tout le trafic vers la zone US-East-2
  4. Réalisation de tests visant à valider la disponibilité des applications et l'accès aux bases de données
  5. Revenir à la zone US-East-1 une fois les tests terminés

CrowdHandler's resilience measures provide safeguards against infrastructure failures, software disruptions, and regional outages. Fault-tolerant systems, replication of data across regions, and regular disaster recovery testing give us confidence in our ability to restore services with minimal downtime even after catastrophic events. Our availability architecture is designed for continuous uptime and a seamless customer experience.