Resiliencia y alta disponibilidad

La infraestructura de CrowdHandler está diseñada para garantizar una disponibilidad y un tiempo de funcionamiento continuos. Utilizamos los siguientes mecanismos de resiliencia y tolerancia a fallos:

AWS Availability Zones

We use multiple availability zones in each AWS region to provide redundancy at the data center level. This protects against failures that could impact an entire zone.

Database Multi-AZ Deployments

Nuestras bases de datos MySQL RDS se implementan en modo multi-AZ en tres zonas de disponibilidad. Esto permite la replicación sincrónica de los datos con conmutación automática por error en caso de fallos en la instancia de la base de datos o de interrupciones en las zonas de disponibilidad.

AWS Region Replication

Replicamos toda la infraestructura y los datos de nuestra región principal US-East-1 a US-East-2. Esto incluye:

  • Instantáneas de bases de datos: realizamos instantáneas cada hora de las bases de datos de producción, que luego se replican en US-East-2. Podemos restaurar el sistema a partir de una instantánea en caso de que se produzca un desastre a nivel regional.
  • Replicación de buckets de S3: todos los datos de los buckets de producción de S3 se replican de forma asíncrona a los buckets de US-East-2.
  • Copias de seguridad de AMI: se realizan copias de seguridad de las imágenes de los servidores EC2 (cuando se utilizan) en la región US-East-2, por si necesitamos poner en marcha servidores de sustitución.
  • Comprobaciones de estado de Route53: utilizamos las comprobaciones de estado de Route53 para supervisar los puntos finales tanto en US-East-1 como en US-East-2. En caso necesario, el tráfico se puede redirigir rápidamente a la región secundaria.

Disaster Recovery Testing

Realizamos pruebas anuales de recuperación ante desastres para garantizar que podamos redirigir todo el tráfico y realizar la conmutación a US-East-2 en caso de que se produzca una interrupción significativa del servicio en US-East-1. Estas pruebas incluyen:

  1. Simulación de una interrupción del servicio en US-East-1 que requeriría una conmutación por error
  2. Promoción de las bases de datos en espera de US-East-2 para que pasen a ser primarias
  3. Actualización del DNS o de los orígenes de las aplicaciones para redirigir todo el tráfico a US-East-2
  4. Realización de pruebas para validar la disponibilidad de la aplicación y el acceso a la base de datos
  5. Volver a US-East-1 una vez finalizadas las pruebas

CrowdHandler's resilience measures provide safeguards against infrastructure failures, software disruptions, and regional outages. Fault-tolerant systems, replication of data across regions, and regular disaster recovery testing give us confidence in our ability to restore services with minimal downtime even after catastrophic events. Our availability architecture is designed for continuous uptime and a seamless customer experience.