Continuidad del negocio y recuperación ante desastres en CrowdHandler

CrowdHandler cuenta con un sólido plan de continuidad del negocio y recuperación ante desastres para minimizar las interrupciones en caso de problemas operativos, fallos en la infraestructura o cortes regionales. Nuestras políticas incluyen:

redundante#

Nuestra infraestructura utiliza:

  • Varias regiones de AWS: mantenemos una réplica de los entornos de producción y los datos en una región secundaria de AWS (US-East-2) por si la región principal (US-East-1) sufriera una interrupción significativa del servicio.
  • Bases de datos Multi-AZ: nuestras instancias de bases de datos RDS se implementan en varias zonas de disponibilidad dentro de una misma región para permitir la conmutación automática por error en caso de que se produzca una interrupción en una sola zona de disponibilidad.
  • Infraestructura elástica: utilizamos grupos de autoescalado siempre que es posible, de modo que los recursos de computación se adapten a la demanda y se mantenga la disponibilidad incluso si es necesario sustituir algún componente concreto.

de recuperación ante desastres#

Llevamos a cabo simulacros de recuperación ante desastres dos veces al año para comprobar los procedimientos de recuperación y minimizar el tiempo de inactividad en caso de que se produzca un desastre real:

  1. Simula un desastre en nuestra región principal de AWS (US-East-1) que impida el acceso a los entornos y a los datos.
  2. Convertir las bases de datos réplica de US-East-2 en bases de datos de producción principales.
  3. Actualiza el DNS para redirigir todo el tráfico a US-East-2 y actualiza la configuración de la aplicación para que apunte a las nuevas bases de datos.
  4. Realice pruebas de conmutación por error para confirmar que los sistemas críticos para el negocio siguen estando disponibles, que las cargas de trabajo se equilibran y que el rendimiento es aceptable durante la interrupción simulada.
  5. Solucionar cualquier problema o riesgo detectado para mejorar la viabilidad de los planes de recuperación ante desastres.
  6. Comprueba que las configuraciones o ajustes modificados vuelvan a su estado normal de funcionamiento.

continua#

Contamos con turnos de guardia las 24 horas del día, los 7 días de la semana, y supervisamos los sistemas mediante:

  • Cuadros de mando de CloudWatch: realizamos un seguimiento de los indicadores clave de rendimiento y los umbrales para la detección temprana de interrupciones en todos los servicios.
  • Alarmas de CloudWatch: configuramos alarmas para que avisen de cualquier desviación respecto a los valores esperados, de modo que los problemas puedan investigarse con rapidez.
  • Turnos de guardia: los miembros del personal se turnan en un sistema de guardia de 24 horas por si se activara alguna alerta de CloudWatch fuera del horario laboral. El personal de guardia dispone de guías operativas para problemas habituales, listas para minimizar los retrasos.

La planificación de la continuidad del negocio y la recuperación ante desastres de CrowdHandler proporciona un marco para prepararnos y protegernos frente a interrupciones del sistema. Las políticas tienen como objetivo minimizar el tiempo de inactividad mediante el uso de una infraestructura redundante, capacidades de conmutación por error y scripts de restauración, todo ello respaldado por un plan definido que describe los pasos para recuperarse ante situaciones de desastre. Las pruebas frecuentes de los planes ayudan a garantizar que seamos capaces de reaccionar con rapidez ante una emergencia real para evitar la pérdida de datos o una indisponibilidad prolongada. La supervisión continua actúa como un sistema de alerta temprana que nos permite responder con rapidez.