Ausfallsicherheit und Hochverfügbarkeit
Die Infrastruktur von CrowdHandler ist auf kontinuierliche Verfügbarkeit und Betriebszeit ausgelegt. Wir setzen folgende Mechanismen zur Ausfallsicherheit und Fehlertoleranz ein:
AWS-Verfügbarkeitszonen
Wir nutzen mehrere Verfügbarkeitszonen in jeder AWS-Region, um Redundanz auf Rechenzentrumsebene zu gewährleisten. Dies schützt vor Ausfällen, die eine gesamte Zone betreffen könnten.
Multi-AZ-Bereitstellungen von Datenbanken
Unsere MySQL-RDS-Datenbanken werden im Multi-AZ-Modus über drei Verfügbarkeitszonen hinweg bereitgestellt. Dies gewährleistet eine synchrone Datenreplikation mit automatischem Failover im Falle von Störungen der Datenbankinstanz oder Ausfällen in einer Verfügbarkeitszone.
Replikation zwischen AWS-Regionen
Wir replizieren die gesamte Infrastruktur und alle Daten aus unserer primären Region „US-East-1“ in die Region „US-East-2“. Dazu gehören:
- Datenbank-Snapshots – Wir erstellen stündliche Snapshots der Produktionsdatenbanken, die anschließend auf US-East-2 repliziert werden. Im Falle einer Katastrophe auf Regionsebene können wir die Daten aus einem Snapshot wiederherstellen.
- S3-Bucket-Replikation – Alle Daten in den S3-Produktions-Buckets werden asynchron in US-East-2-Buckets repliziert.
- AMI-Backups – Images von EC2-Servern (sofern verwendet) werden in der Region „US-East-2“ gesichert, für den Fall, dass wir Ersatzserver bereitstellen müssen.
- Route53-Zustandsprüfungen – Wir nutzen Route53-Zustandsprüfungen, um Endpunkte sowohl in US-East-1 als auch in US-East-2 zu überwachen. Der Datenverkehr kann bei Bedarf schnell in die sekundäre Region umgeleitet werden.
Tests zur Notfallwiederherstellung
Wir führen jährlich Tests zur Notfallwiederherstellung durch, um sicherzustellen, dass wir im Falle eines größeren Ausfalls in US-East-1 den gesamten Datenverkehr umleiten und auf US-East-2 umschalten können. Diese Tests umfassen:
- Simulation eines Ausfalls in US-East-1, der ein Failover erfordern würde
- Standby-Datenbanken in US-East-2 als Primärdatenbanken einrichten
- Aktualisierung der DNS- oder Anwendungs-Origins, um den gesamten Datenverkehr an „US-East-2“ weiterzuleiten
- Durchführung von Tests zur Überprüfung der Anwendungsverfügbarkeit und des Datenbankzugriffs
- Nach Abschluss der Tests wieder auf „US-East-1“ umschalten
Die Ausfallsicherheitsmaßnahmen von CrowdHandler bieten Schutz vor Infrastrukturausfällen, Softwareproblemen und regionalen Ausfällen. Fehlertolerante Systeme, die regionenübergreifende Datenreplikation und regelmäßige Tests zur Notfallwiederherstellung geben uns die Gewissheit, dass wir unsere Dienste selbst nach katastrophalen Ereignissen mit minimalen Ausfallzeiten wiederherstellen können. Unsere Verfügbarkeitsarchitektur ist auf kontinuierliche Betriebsbereitschaft und ein nahtloses Kundenerlebnis ausgelegt.