Journaux, surveillance et alertes de performances sur CrowdHandler

CrowdHandler utilise des systèmes de journalisation et de surveillance à l'échelle de notre infrastructure et de nos applications afin d'obtenir une visibilité sur l'état de santé opérationnel, de garantir la disponibilité et de détecter rapidement les problèmes potentiels. Notre pile de journalisation et de surveillance comprend :

Nous utilisons Amazon CloudWatch Logs pour collecter les journaux provenant de :

  • Fonctions AWS Lambda: enregistrement de toutes les exécutions de nos fonctions Lambda qui exécutent le code de notre application principale. Conservation pendant 12 mois.
  • Journaux d'accès à API Gateway: enregistrent tous les appels API effectués par les utilisateurs finaux anonymes et les utilisateurs/administrateurs clients enregistrés. Conservés pendant 12 mois.
  • Journaux de base de données AWS RDS: ils enregistrent les activités de lecture/écriture ainsi que les indicateurs de performances de nos bases de données MySQL. Ils sont conservés conformément aux paramètres de conservation des journaux RDS.
  • Journaux AWS CloudTrail: enregistrent toutes les activités liées aux API AWS de notre compte. Conservés pendant 12 mois.

Ces journaux nous permettent d'analyser les habitudes d'utilisation, de résoudre les erreurs logicielles ou les problèmes de performances, et de détecter les anomalies de sécurité. Cependant, nous n'avons pas accès aux journaux contenant des données sensibles sur les clients, mais uniquement à ceux relatifs à notre propre infrastructure et à nos applications.

Nous utilisons Amazon CloudWatch pour surveiller les indicateurs de performance clés de l'ensemble de nos ressources AWS, notamment :

  • Lambda - Suivi des durées d'exécution, des taux d'erreur et de la limitation de débit pour nos fonctions sans serveur.
  • API Gateway - Surveillance des taux d'erreurs 5XX/4XX, de la latence, du nombre de requêtes et de la limitation du débit pour nos API.
  • RDS MySQL - Surveillance de l'utilisation du processeur, de la mémoire, des E/S, de l'espace d'échange et du décalage de réplication pour nos bases de données.
  • S3 - Suivi de l'utilisation de l'espace de stockage et des indicateurs de requêtes pour notre système de stockage de fichiers.
  • Route53 - Surveillance des fréquences et des temps de latence des requêtes DNS.
  • CloudFront - Surveillance des débits de requêtes et de transfert de données, des taux d'erreurs 4XX/5XX et des temps de latence pour la diffusion de contenu.

de performances#

Nous avons configuré des alarmes CloudWatch sur les indicateurs critiques afin de recevoir des notifications lorsque les seuils sont dépassés pour :

  • Taux d'erreurs d'application élevés (Lambda, API Gateway)
  • Utilisation du processeur et de la mémoire par la base de données supérieure à 75 %
  • Retard de réplication supérieur à 2 minutes
  • Taux d'erreurs 4XX/5XX de CloudFront supérieur à 2 %
  • Durée de la fonction Lambda supérieure à 3 secondes
  • Écart de charge en rafale S3 supérieur à 25 % pendant plus de 30 minutes

Ces alertes nous permettent de réagir rapidement en cas d'erreurs logicielles, de problèmes d'infrastructure ou de pics de trafic susceptibles d'affecter notre service. Les membres de l'équipe d'astreinte sont avertis via un système de notification d'alerte 24 heures sur 24, 7 jours sur 7, 365 jours par an.

La pile d'observabilité de CrowdHandler, qui comprend des fonctionnalités de journalisation, de surveillance et d'alerte, nous permet d'assurer un suivi continu de l'état, des performances et de la sécurité de notre infrastructure et de nos applications. Bien que nous n'enregistrions ni ne surveillions les données de nos clients, nous disposons d'une visibilité sur les indicateurs clés des systèmes qui sous-tendent notre service, ce qui nous permet de minimiser les perturbations et de résoudre rapidement tout problème. Notre système d'alerte garantit une réponse rapide en cas de problèmes logiciels ou d'infrastructure, à tout moment.

N'hésitez pas à nous contacter si vous avez des questions concernant nos politiques en matière de journalisation, de surveillance et d'alertes de performance, ou si vous souhaitez obtenir de plus amples informations.