Clúster de alta disponibilidad
Tus servicios siguen funcionando cuando un servidor se cae
Creamos clústeres de alta disponibilidad (HA) en Proxmox VE, Hyper-V, SUSE Virtualization y XCP-ng que detectan fallos de nodos y reinician automáticamente sus máquinas virtuales.
-
Conmutación por error y recuperación automáticas
-
Replicación continua de máquinas virtuales
-
Almacenamiento distribuido con Ceph
-
Detección de fallos en segundos
-
Supervisión y alertas del estado de los nodos
conmutación por error
para recuperarse
Qué te ofrece un clúster de alta disponibilidad
Un clúster de alta disponibilidad mantiene los servicios en funcionamiento durante fallos de hardware, ventanas de mantenimiento e incluso interrupciones regionales. Esto es lo que significa en la práctica.
-
Tiempo de inactividad mínimo
Seguir leyendo MenosCuando un nodo falla, sus máquinas virtuales se reinician en nodos saludables en cuestión de minutos, sin necesidad de intervención manual. Los nodos se actualizan uno a la vez mientras las VM migran en vivo a otros nodos, por lo que el mantenimiento ya no implica una ventana de interrupción.
-
Seguridad de los datos
Seguir leyendo MenosLos datos de la VM se replican continuamente entre nodos o se mantienen en almacenamiento distribuido como Ceph. La pérdida de un disco, un nodo o una ruta de red no deja sus datos fuera de línea.
-
Recuperación predecible
Seguir leyendo MenosLos objetivos de tiempo de recuperación y punto de recuperación se acuerdan durante el diseño y luego se verifican en pruebas de conmutación por error, no se quedan sobre el papel. Cuando el nodo que falló vuelve a estar en servicio, las cargas de trabajo regresan de forma ordenada.
-
Elección de plataforma
Seguir leyendo MenosConstruimos clústeres de alta disponibilidad (HA) en Proxmox VE, Microsoft Hyper-V, SUSE Virtualization y XCP-ng. Cada plataforma aporta su propia pila de replicación y gestión; elegimos aquella con la que sus ingenieros se sentirán realmente cómodos trabajando.
-
Crecimiento sin interrupción
Seguir leyendo MenosLa capacidad crece al agregar nodos al clúster, con las cargas de trabajo reequilibradas entre ellos: los nuevos nodos se incorporan mientras los servicios siguen en funcionamiento. Las máquinas virtuales se distribuyen entre los nodos en función de la carga real, manteniendo tiempos de respuesta constantes.
-
Costos transparentes
Seguir leyendo MenosProxmox VE y XCP-ng incluyen alta disponibilidad (HA) sin coste adicional de licencias: pagas por el hardware y la configuración, no por licencias de clúster por nodo. También se admiten plataformas comerciales, cuando se ajustan a tus licencias existentes.
Cargas de trabajo que requieren un clúster HA
- Bases de datos y colas de mensajes
- Comercio electrónico y sistemas de pago
- Plataformas SaaS y portales para clientes
- ERP, CRM y aplicaciones críticas para el negocio
- Sistemas de atención médica y regulados
- Servicios de streaming y en tiempo real
- Servicios de archivos y almacenamiento
- VoIP y plataformas de comunicación
Clúster HA llave en mano: del diseño
al failover verificado
-
1
Evaluación y diseño
Identificamos sus aplicaciones críticas, el tiempo de inactividad aceptable y los objetivos de recuperación. Auditamos el hardware, la red y el almacenamiento existentes. En función de ello, diseñamos el clúster —cantidad de nodos, distribución del almacenamiento y lógica de conmutación por error— para cumplir esos objetivos.
-
2
Configuración de nodos y red
Configuramos los servidores como nodos de clúster con interconexiones redundantes. Las IP de conmutación por error y la redundancia de red se configuran y verifican. Se implementa almacenamiento compartido o distribuido para la redundancia de datos.
-
3
Configuración del clúster
Instalamos y configuramos servicios de clúster en Proxmox VE, Microsoft Hyper-V, SUSE Virtualization o XCP-ng. Los recursos del clúster —IP virtuales, almacenamiento y cómputo— se definen y priorizan. Las reglas de conmutación por error y recuperación automática se configuran para cada carga de trabajo.
-
4
Pruebas de conmutación por error
Simulamos fallos de nodos y verificamos que las máquinas virtuales se reinicien donde corresponde, dentro del tiempo acordado. El rendimiento bajo carga de conmutación por error se mide, no se asume. También se prueba la recuperación ante escenarios de fallos de almacenamiento y red.
-
5
Monitoreo y mantenimiento
La monitorización supervisa el estado de los nodos, el estado de la replicación y el quórum del clúster. Las alertas se activan ante eventos críticos: pérdida de nodos, replicación degradada, agotamiento de recursos. El mantenimiento programado mantiene el clúster estable sin interrumpir los servicios.
-
6
Soporte continuo
Nuestros ingenieros siguen disponibles para la resolución de problemas y cambios de configuración. Aplicamos actualizaciones y mejoras nodo por nodo, sin tiempo de inactividad del clúster.
Preguntas frecuentes
-
¿Qué tan rápido ocurre realmente la conmutación por error?
En la mayoría de las configuraciones de alta disponibilidad, una máquina virtual de un nodo con errores se reinicia en uno saludable en un plazo de uno a cinco minutos; el tiempo exacto depende de la plataforma, el almacenamiento y la rapidez con la que arranque el sistema operativo invitado. En eventos planificados, la migración en vivo mueve las máquinas virtuales sin ninguna interrupción. Si incluso un minuto es demasiado, consulta la pregunta sobre tolerancia a fallos a continuación.
-
¿Cuántos servidores necesito para un clúster de alta disponibilidad?
Tres nodos son el mínimo práctico: un clúster necesita una mayoría de votos (quórum) para decidir qué nodos están en buen estado y evitar situaciones de split-brain. Es posible una configuración de dos nodos con un dispositivo de quórum externo, pero recomendamos una configuración de tres o más nodos.
-
¿Los cuatro hipervisores admiten alta disponibilidad?
Sí. Proxmox VE cuenta con un gestor de alta disponibilidad integrado, Microsoft Hyper-V utiliza la conmutación por error en clúster de Windows Server, SUSE Virtualization incluye alta disponibilidad de serie y XCP-ng la ofrece a través de su pila de gestión. Los principios son los mismos: las herramientas difieren y las adaptamos a su equipo.
-
¿Qué almacenamiento requiere un clúster de alta disponibilidad?
La conmutación por error solo funciona si cada nodo puede acceder a los datos de la VM, por lo que el clúster necesita almacenamiento compartido o distribuido, por ejemplo Ceph, volúmenes replicados o un sistema de almacenamiento externo. Los discos puramente locales no son suficientes; diseñamos la capa de almacenamiento junto con el clúster.
-
¿Me protege un clúster de alta disponibilidad contra la pérdida de datos?
La alta disponibilidad protege la disponibilidad, no el historial: si los datos se corrompen o se eliminan, la replicación copia fielmente el daño en cada nodo. Por eso, las copias de seguridad siguen siendo obligatorias junto con cualquier clúster. La cantidad de datos recientes que puede perder una conmutación por error depende de si la replicación es síncrona o asíncrona, y la configuramos de acuerdo con su objetivo de punto de recuperación.
-
¿Notarán algo los usuarios durante una conmutación por error?
En eventos planificados —mantenimiento, redistribución de carga— las máquinas virtuales se mueven en vivo entre nodos y los usuarios no notan nada. En caso de una falla no planificada de un nodo, las VM afectadas se reinician en otro nodo, por lo que las sesiones activas en esas VM se interrumpen brevemente y luego se reanudan. Las aplicaciones bien diseñadas se reconectan automáticamente y, para la mayoría de los usuarios, parece una recarga de página.
-
¿Cuál es la diferencia entre alta disponibilidad y tolerancia a fallos?
La alta disponibilidad reinicia las máquinas virtuales afectadas en otro nodo; hay una breve interrupción. La tolerancia a fallos mantiene un espejo activo de la máquina en ejecución, por lo que un fallo de un nodo no causa ninguna interrupción, a costa de aproximadamente el doble de recursos. La mayoría de las cargas de trabajo funcionan bien con HA; la tolerancia a fallos se reserva para las pocas que no pueden tolerar ni siquiera segundos de inactividad.
-
¿Mis aplicaciones necesitan cambios para ejecutarse en un clúster de alta disponibilidad?
Por lo general, no: la alta disponibilidad a nivel de VM es transparente para las aplicaciones internas. Para bases de datos y otros servicios con estado, se puede añadir replicación a nivel de aplicación sobre la alta disponibilidad del clúster para obtener garantías de recuperación aún más estrictas, pero es una opción, no un requisito.