Continuité d'activité et reprise après sinistre chez CrowdHandler
CrowdHandler a mis en place un dispositif solide de continuité d'activité et de reprise après sinistre afin de minimiser les perturbations en cas de problèmes opérationnels, de défaillances de l'infrastructure ou de coupures régionales. Nos politiques comprennent :
redondante#
Notre infrastructure s'appuie sur :
- Plusieurs régions AWS – Nous conservons une réplique des environnements de production et des données dans une région AWS secondaire (US-East-2) au cas où la région principale (US-East-1) subirait une panne majeure.
- Bases de données multi-AZ: nos instances de base de données RDS sont déployées dans plusieurs zones de disponibilité au sein d'une même région afin de permettre un basculement automatique en cas de panne d'une zone de disponibilité.
- Infrastructure élastique - Nous utilisons, dans la mesure du possible, des groupes à dimensionnement automatique afin que les ressources de calcul s'adaptent à la demande et que la disponibilité soit maintenue même si certains composants doivent être remplacés.
de reprise après sinistre#
Nous organisons deux fois par an des exercices de reprise après sinistre afin de valider les procédures de reprise et de réduire au minimum les temps d'arrêt en cas de sinistre réel :
- Simulez une catastrophe dans notre région AWS principale (US-East-1) rendant les environnements et les données inaccessibles.
- Promouvoir les bases de données répliquées dans la zone US-East-2 afin qu'elles deviennent des bases de données de production principales.
- Mettez à jour le DNS pour acheminer tout le trafic vers US-East-2 et modifiez les paramètres de l'application pour qu'ils pointent vers les nouvelles bases de données.
- Effectuez des tests de basculement afin de vérifier que les systèmes essentiels à l'activité restent disponibles, que la charge de travail est répartie de manière équilibrée et que les performances restent acceptables pendant la simulation de panne.
- Remédier à tous les problèmes ou risques identifiés afin d'améliorer la viabilité des plans de reprise après sinistre.
- Vérifiez que toutes les configurations ou tous les paramètres modifiés ont bien été rétablis à leur état normal.
continue#
Nous assurons des permanences 24 heures sur 24, 7 jours sur 7, et surveillons les systèmes à l'aide des outils suivants :
- Tableaux de bord CloudWatch: nous surveillons les indicateurs de performance clés et les seuils afin de détecter rapidement les interruptions de service, tous services confondus.
- Alarmes CloudWatch - Nous configurons des alarmes pour signaler tout écart par rapport aux valeurs attendues, afin que les problèmes puissent être examinés rapidement.
- Plans de permanence – Les membres du personnel assurent une permanence par rotation de 24 heures afin de pouvoir intervenir en cas de déclenchement d'alertes CloudWatch en dehors des heures de bureau. Le personnel de permanence dispose de guides d'intervention pour les problèmes courants, afin de limiter les retards.
Les plans de continuité d'activité et de reprise après sinistre de CrowdHandler fournissent un cadre permettant de se préparer aux perturbations du système et de s'en prémunir. Ces politiques visent à réduire au minimum les temps d'arrêt grâce à une infrastructure redondante, à des capacités de basculement et à des scripts de restauration, le tout s'appuyant sur un plan défini décrivant les étapes à suivre pour faire face à des scénarios de sinistre. Des tests fréquents de ces plans permettent de garantir notre capacité à réagir rapidement en cas d'urgence réelle, afin d'éviter toute perte de données ou indisponibilité prolongée. La surveillance continue fait office de système d'alerte précoce, ce qui nous permet d'intervenir rapidement.