Protokolle, Überwachung und Leistungswarnungen bei CrowdHandler

CrowdHandler nutzt Protokollierung und Überwachung in unserer gesamten Infrastruktur und Anwendung, um Einblicke in den Betriebszustand zu gewinnen, die Verfügbarkeit sicherzustellen und potenzielle Probleme frühzeitig zu erkennen. Unser Protokollierungs- und Überwachungs-Stack umfasst:

Protokollierung

Wir nutzen Amazon CloudWatch Logs, um Protokolle aus folgenden Quellen zu erfassen:

  • AWS Lambda-Funktionen – Protokolliert alle Ausführungen unserer Lambda-Funktionen, die den Kerncode unserer Anwendung ausführen. Die Daten werden 12 Monate lang aufbewahrt.
  • API-Gateway-Zugriffsprotokolle – Protokollieren alle API-Aufrufe von anonymen Endnutzern und registrierten Client-Nutzern/Administratoren. Die Aufbewahrungsfrist beträgt 12 Monate.
  • AWS RDS-Datenbankprotokolle – Erfassen Lese- und Schreibvorgänge sowie Leistungskennzahlen für unsere MySQL-Datenbanken. Die Aufbewahrungsdauer richtet sich nach den RDS-Einstellungen zur Protokollaufbewahrung.
  • AWS CloudTrail-Protokolle – Protokollieren alle AWS-API-Aktivitäten für unser Konto. Die Aufbewahrungsfrist beträgt 12 Monate.

Anhand dieser Protokolle können wir Nutzungsmuster nachverfolgen, Softwarefehler oder Leistungsprobleme beheben und auf Sicherheitsanomalien achten. Wir haben jedoch keinen Zugriff auf Protokolle, die sensible Kundendaten enthalten, sondern lediglich auf unsere eigenen Infrastruktur- und Anwendungsprotokolle.

Überwachung

Wir nutzen Amazon CloudWatch zur Überwachung wichtiger Leistungskennzahlen unserer AWS-Ressourcen, darunter:

  • Lambda – Überwachung von Ausführungszeiten, Fehlerquoten und Drosselung für unsere serverlosen Funktionen.
  • API-Gateway – Überwachung der 5XX-/4XX-Fehlerraten, der Latenz, der Anzahl der Anfragen und der Drosselung für unsere APIs.
  • RDS MySQL – Überwachung von CPU, Arbeitsspeicher, E/A, Swap-Auslastung und Replikationsverzögerung für unsere Datenbanken.
  • S3 – Überwachung der Speichernutzung und der Anforderungsmetriken für unseren Dateispeicher.
  • Route53 – Überwachung der DNS-Abfragefrequenzen und -Latenzen.
  • CloudFront – Überwachung der Anfrage- und Datenübertragungsraten, der 4XX-/5XX-Fehlerraten sowie der Latenzen bei der Bereitstellung von Inhalten.

Leistungswarnungen

Wir haben CloudWatch-Alarme für kritische Kennzahlen eingerichtet, damit wir Benachrichtigungen erhalten, wenn die Schwellenwerte für folgende Kennzahlen überschritten werden:

  • Erhöhte Fehlerraten bei Anwendungen (Lambda, API Gateway)
  • CPU-/Speicherauslastung der Datenbank über 75 %
  • Replikationsverzögerung von über 2 Minuten
  • CloudFront-Fehlerraten von über 2 % (4XX/5XX)
  • Die Laufzeit der Lambda-Funktion beträgt mehr als 3 Sekunden
  • S3-Burst-Balance von mehr als 25 % über einen Zeitraum von mehr als 30 Minuten

Diese Warnmeldungen ermöglichen es uns, bei Softwarefehlern, Infrastrukturproblemen oder Traffic-Spitzen, die sich möglicherweise auf unseren Dienst auswirken könnten, schnell zu reagieren. Die Mitglieder des Bereitschaftsteams werden rund um die Uhr an 365 Tagen im Jahr über ein Warnmeldesystem benachrichtigt.

Der Observability-Stack von CrowdHandler, der Protokollierung, Überwachung und Alarmierung umfasst, sorgt für einen kontinuierlichen Einblick in den Zustand, die Leistung und die Sicherheit unserer Infrastruktur und Anwendungen. Wir protokollieren oder überwachen zwar keine Kundendaten, erhalten jedoch Einblick in wichtige Kennzahlen aller Systeme, die unseren Dienst unterstützen, sodass wir Störungen minimieren und etwaige Probleme schnell beheben können. Unser Alarmierungssystem gewährleistet jederzeit eine schnelle Reaktion im Falle von Software- oder Infrastrukturproblemen.

Bitte teilen Sie uns mit, falls Sie Fragen zu unseren Richtlinien zur Protokollierung, Überwachung und Leistungswarnung haben oder weitere Informationen benötigen.