Geschäftskontinuität und Notfallwiederherstellung bei CrowdHandler
CrowdHandler verfügt über eine solide Planung für Geschäftskontinuität und Notfallwiederherstellung, um Störungen im Falle von Betriebsproblemen, Infrastrukturausfällen oder regionalen Ausfällen auf ein Minimum zu beschränken. Zu unseren Richtlinien gehören:
Redundante Infrastruktur
Unsere Infrastruktur nutzt:
- Mehrere AWS-Regionen – Wir unterhalten eine Kopie der Produktionsumgebungen und -daten in einer sekundären AWS-Region (US-East-2) für den Fall, dass in der primären Region (US-East-1) ein größerer Ausfall auftritt.
- Multi-AZ-Datenbanken – Unsere RDS-Datenbankinstanzen werden über mehrere Verfügbarkeitszonen innerhalb einer Region verteilt, um im Falle einer Störung in einer einzelnen Verfügbarkeitszone ein automatisches Failover zu ermöglichen.
- Elastische Infrastruktur – Wir setzen, wo immer möglich, Auto-Scaling-Gruppen ein, damit sich die Rechenressourcen bedarfsgerecht skalieren lassen und die Verfügbarkeit auch dann gewährleistet bleibt, wenn einzelne Komponenten ausgetauscht werden müssen.
Tests zur Notfallwiederherstellung
Wir führen zweimal jährlich Notfallwiederherstellungsübungen durch, um die Wiederherstellungsverfahren zu überprüfen und Ausfallzeiten im Falle eines tatsächlichen Notfalls so gering wie möglich zu halten:
- Simulieren Sie eine Katastrophe in unserer primären AWS-Region (US-East-1), durch die Umgebungen und Daten nicht mehr zugänglich sind.
- Replikationsdatenbanken in US-East-2 zu primären Produktionsdatenbanken hochstufen.
- Passen Sie die DNS-Einstellungen so an, dass der gesamte Datenverkehr an „US-East-2“ weitergeleitet wird, und aktualisieren Sie die Anwendungseinstellungen, sodass sie auf die neuen Datenbanken verweisen.
- Führen Sie Failover-Tests durch, um sicherzustellen, dass geschäftskritische Systeme während des simulierten Ausfalls weiterhin verfügbar sind, die Workloads ausgeglichen werden und die Leistung akzeptabel ist.
- Beheben Sie alle festgestellten Probleme oder Risiken, um die Durchführbarkeit der Notfallwiederherstellungspläne zu verbessern.
- Testen Sie, ob sich geänderte Konfigurationen oder Einstellungen wieder in den Normalzustand zurücksetzen lassen.
Kontinuierliche Überwachung
Wir arbeiten im 24/7-Pikettdienst und überwachen die Systeme mithilfe folgender Mittel:
- CloudWatch-Dashboards – Wir überwachen wichtige Leistungskennzahlen und Schwellenwerte, um Ausfälle dienstübergreifend frühzeitig zu erkennen.
- CloudWatch-Alarme – Wir richten Alarme ein, die bei Abweichungen von den erwarteten Werten eine Benachrichtigung auslösen, damit Probleme umgehend untersucht werden können.
- Pikettpläne – Die Mitarbeiter wechseln sich im 24-Stunden-Pikett ein, für den Fall, dass außerhalb der Geschäftszeiten CloudWatch-Warnmeldungen ausgelöst werden. Die Pikettmitarbeiter verfügen über Runbooks für häufige Probleme, um Verzögerungen zu vermeiden.
Die Planung zur Geschäftskontinuität und Notfallwiederherstellung von CrowdHandler bietet einen Rahmen, um sich auf Systemausfälle vorzubereiten und sich davor zu schützen. Die Richtlinien zielen darauf ab, Ausfallzeiten durch den Einsatz redundanter Infrastruktur, Failover-Funktionen und Wiederherstellungsskripte zu minimieren, die durch einen definierten Plan unterstützt werden, in dem die Schritte zur Wiederherstellung nach Notfallszenarien dargelegt sind. Regelmäßige Tests der Pläne tragen dazu bei, dass wir im Ernstfall schnell reagieren können, um Datenverluste oder längere Ausfallzeiten zu vermeiden. Die kontinuierliche Überwachung dient als Frühwarnsystem, sodass wir rasch reagieren können.