Continuidad del negocio y recuperación ante desastres en CrowdHandler
CrowdHandler cuenta con un sólido plan de continuidad del negocio y recuperación ante desastres para minimizar las interrupciones en caso de problemas operativos, fallos en la infraestructura o cortes regionales. Nuestras políticas incluyen:
Redundant Infrastructure
Our infrastructure uses:
- Varias regiones de AWS: mantenemos una réplica de los entornos de producción y los datos en una región secundaria de AWS (US-East-2) por si la región principal (US-East-1) sufriera una interrupción significativa del servicio.
- Bases de datos Multi-AZ: nuestras instancias de bases de datos RDS se implementan en varias zonas de disponibilidad dentro de una misma región para permitir la conmutación automática por error en caso de que se produzca una interrupción en una sola zona de disponibilidad.
- Infraestructura elástica: utilizamos grupos de autoescalado siempre que es posible, de modo que los recursos de computación se adapten a la demanda y se mantenga la disponibilidad incluso si es necesario sustituir algún componente concreto.
Disaster Recovery Testing
Llevamos a cabo simulacros de recuperación ante desastres dos veces al año para comprobar los procedimientos de recuperación y minimizar el tiempo de inactividad en caso de que se produzca un desastre real:
- Simula un desastre en nuestra región principal de AWS (US-East-1) que impida el acceso a los entornos y a los datos.
- Convertir las bases de datos réplica de US-East-2 en bases de datos de producción principales.
- Actualiza el DNS para redirigir todo el tráfico a US-East-2 y actualiza la configuración de la aplicación para que apunte a las nuevas bases de datos.
- Conduct failover testing to confirm business-critical systems remain available, workloads are balancing, and performance is acceptable during the simulated outage.
- Solucionar cualquier problema o riesgo detectado para mejorar la viabilidad de los planes de recuperación ante desastres.
- Comprueba que las configuraciones o ajustes modificados vuelvan a su estado normal de funcionamiento.
Continuous Monitoring
Contamos con turnos de guardia las 24 horas del día, los 7 días de la semana, y supervisamos los sistemas mediante:
- Cuadros de mando de CloudWatch: realizamos un seguimiento de los indicadores clave de rendimiento y los umbrales para la detección temprana de interrupciones en todos los servicios.
- Alarmas de CloudWatch: configuramos alarmas para que avisen de cualquier desviación respecto a los valores esperados, de modo que los problemas puedan investigarse con rapidez.
- Turnos de guardia: los miembros del personal se turnan en un sistema de guardia de 24 horas por si se activara alguna alerta de CloudWatch fuera del horario laboral. El personal de guardia dispone de guías operativas para problemas habituales, listas para minimizar los retrasos.
CrowdHandler's business continuity and disaster recovery planning provide a framework to prepare for and safeguard against system disruptions. Policies aim to minimize downtime by using redundant infrastructure, failover capabilities, and restoration scripts supported by a defined plan outlining steps to recover from disaster scenarios. Frequent testing of plans helps guarantee we are able to react swiftly in an actual emergency to avoid data loss or prolonged unavailability. Continuous monitoring acts as an early warning system so we can respond rapidly.