Continuità operativa e ripristino di emergenza presso CrowdHandler
CrowdHandler dispone di un solido piano di continuità operativa e di ripristino in caso di emergenza, volto a ridurre al minimo le interruzioni in caso di problemi operativi, guasti alle infrastrutture o interruzioni di servizio a livello regionale. Le nostre politiche prevedono:
ridondante#
La nostra infrastruttura si avvale di:
- Più regioni AWS - Manteniamo una replica degli ambienti di produzione e dei dati in una regione AWS secondaria (US-East-2) nel caso in cui la regione primaria (US-East-1) subisca un'interruzione significativa del servizio.
- Database multi-AZ - Le nostre istanze di database RDS sono distribuite su più zone di disponibilità all’interno di una regione per consentire il failover automatico in caso di interruzione del servizio in una singola zona di disponibilità.
- Infrastruttura elastica - Laddove possibile, utilizziamo gruppi di auto-scaling in modo che le risorse di calcolo si adattino alla domanda e garantiscano la disponibilità anche nel caso in cui singoli componenti debbano essere sostituiti.
di ripristino in caso di disastri#
Due volte all'anno conduciamo esercitazioni di ripristino in caso di emergenza per verificare l'efficacia delle procedure di ripristino e ridurre al minimo i tempi di inattività in uno scenario di emergenza reale:
- Simulare un disastro nella nostra regione AWS principale (US-East-1) che renda inaccessibili gli ambienti e i dati.
- Elevare i database di replica presenti in US-East-2 a database di produzione primari.
- Aggiornare il DNS per instradare tutto il traffico verso US-East-2 e aggiornare le impostazioni dell'applicazione in modo che puntino ai nuovi database.
- Eseguire test di failover per verificare che i sistemi critici per l'azienda rimangano disponibili, che i carichi di lavoro siano bilanciati e che le prestazioni siano accettabili durante l'interruzione simulata.
- Risolvere eventuali problemi o rischi individuati per migliorare l'efficacia dei piani di ripristino in caso di emergenza.
- Verificare il ripristino delle configurazioni o delle impostazioni modificate alle condizioni di funzionamento normali.
continuo#
Adottiamo turni di reperibilità 24 ore su 24, 7 giorni su 7, e monitoriamo i sistemi utilizzando:
- Dashboard di CloudWatch - Monitoriamo le metriche chiave di prestazione e le soglie per il rilevamento tempestivo delle interruzioni di servizio.
- Allarmi CloudWatch - Configuriamo gli allarmi in modo che segnalino eventuali scostamenti dai valori previsti, consentendo così di indagare tempestivamente sui problemi.
- Turni di reperibilità - I membri dello staff si alternano in turni di reperibilità di 24 ore per intervenire nel caso in cui vengano attivati avvisi di CloudWatch al di fuori dell'orario di lavoro. Il personale di reperibilità dispone di guide operative per i problemi più comuni, pronte per ridurre al minimo i ritardi.
La pianificazione della continuità operativa e del ripristino di emergenza di CrowdHandler fornisce un quadro di riferimento per prepararsi e proteggersi dalle interruzioni del sistema. Le politiche mirano a ridurre al minimo i tempi di inattività utilizzando infrastrutture ridondanti, funzionalità di failover e script di ripristino supportati da un piano definito che delinea le fasi per il ripristino in caso di scenari di emergenza. I test frequenti dei piani contribuiscono a garantire la nostra capacità di reagire rapidamente in caso di emergenza reale, al fine di evitare la perdita di dati o un'indisponibilità prolungata. Il monitoraggio continuo funge da sistema di allerta precoce, consentendoci di intervenire rapidamente.