Continuité d'activité et reprise après sinistre chez CrowdHandler
CrowdHandler a mis en place un dispositif solide de continuité d'activité et de reprise après sinistre afin de minimiser les perturbations en cas de problèmes opérationnels, de défaillances de l'infrastructure ou de coupures régionales. Nos politiques comprennent :
Redundant Infrastructure
Our infrastructure uses:
- Plusieurs régions AWS – Nous conservons une réplique des environnements de production et des données dans une région AWS secondaire (US-East-2) au cas où la région principale (US-East-1) subirait une panne majeure.
- Bases de données multi-AZ: nos instances de base de données RDS sont déployées dans plusieurs zones de disponibilité au sein d'une même région afin de permettre un basculement automatique en cas de panne d'une zone de disponibilité.
- Infrastructure élastique - Nous utilisons, dans la mesure du possible, des groupes à dimensionnement automatique afin que les ressources de calcul s'adaptent à la demande et que la disponibilité soit maintenue même si certains composants doivent être remplacés.
Disaster Recovery Testing
Nous organisons deux fois par an des exercices de reprise après sinistre afin de valider les procédures de reprise et de réduire au minimum les temps d'arrêt en cas de sinistre réel :
- Simulez une catastrophe dans notre région AWS principale (US-East-1) rendant les environnements et les données inaccessibles.
- Promouvoir les bases de données répliquées dans la zone US-East-2 afin qu'elles deviennent des bases de données de production principales.
- Mettez à jour le DNS pour acheminer tout le trafic vers US-East-2 et modifiez les paramètres de l'application pour qu'ils pointent vers les nouvelles bases de données.
- Conduct failover testing to confirm business-critical systems remain available, workloads are balancing, and performance is acceptable during the simulated outage.
- Remédier à tous les problèmes ou risques identifiés afin d'améliorer la viabilité des plans de reprise après sinistre.
- Vérifiez que toutes les configurations ou tous les paramètres modifiés ont bien été rétablis à leur état normal.
Continuous Monitoring
Nous assurons des permanences 24 heures sur 24, 7 jours sur 7, et surveillons les systèmes à l'aide des outils suivants :
- Tableaux de bord CloudWatch: nous surveillons les indicateurs de performance clés et les seuils afin de détecter rapidement les interruptions de service, tous services confondus.
- Alarmes CloudWatch - Nous configurons des alarmes pour signaler tout écart par rapport aux valeurs attendues, afin que les problèmes puissent être examinés rapidement.
- Plans de permanence – Les membres du personnel assurent une permanence par rotation de 24 heures afin de pouvoir intervenir en cas de déclenchement d'alertes CloudWatch en dehors des heures de bureau. Le personnel de permanence dispose de guides d'intervention pour les problèmes courants, afin de limiter les retards.
CrowdHandler's business continuity and disaster recovery planning provide a framework to prepare for and safeguard against system disruptions. Policies aim to minimize downtime by using redundant infrastructure, failover capabilities, and restoration scripts supported by a defined plan outlining steps to recover from disaster scenarios. Frequent testing of plans helps guarantee we are able to react swiftly in an actual emergency to avoid data loss or prolonged unavailability. Continuous monitoring acts as an early warning system so we can respond rapidly.