Alta disponibilidad: qué significa y cuánto cuesta de verdad
La alta disponibilidad no es un producto que se contrata: es una arquitectura donde ningún componente puede tirar el servicio solo. Cada nivel adicional de disponibilidad cuesta aproximadamente el doble que el anterior, porque hay que duplicar componentes y agregar el mecanismo que decide cuándo cambiar. La pregunta correcta no es cuánta querés sino cuánto te cuesta una hora caído.
Qué significa cada nivel
| Disponibilidad | Corte máximo por mes | Por año | Qué hace falta |
|---|---|---|---|
| 99 % | 7 h 18 min | 3,65 días | Un servidor con respaldos |
| 99,9 % | 43 min | 8,8 h | Servidor con recuperación rápida |
| 99,95 % | 21 min | 4,4 h | Componentes redundantes |
| 99,99 % | 4 min | 52 min | Todo duplicado, cambio automático |
| 99,999 % | 26 s | 5 min | Varios sitios, sin intervención humana |
El salto de 99,9 a 99,99 no es un 0,09 por ciento más: es pasar de 43 minutos a 4, y eso ya no lo resuelve una persona respondiendo una alerta.
Los componentes que hay que duplicar
- Energía: dos alimentaciones por equipo, en circuitos distintos.
- Red: dos placas, a dos conmutadores distintos.
- Almacenamiento: discos en espejo y, si el nivel lo pide, almacenamiento replicado.
- Servidor: al menos dos, con el mecanismo que decide cuál atiende.
- Base de datos: réplica con promoción automática o manual, según el nivel.
- Enlace a internet: dos proveedores distintos, con anuncio propio de rutas.
La cuenta que define el nivel
Calculá cuánto factura tu operación por hora y multiplicalo por las horas de corte que permite cada nivel. Después compará ese número con lo que cuesta subir un escalón.
Para muchas empresas, el resultado muestra que 99,9 por ciento es el punto razonable: el costo de subir a 99,99 supera lo que se pierde en esos 39 minutos anuales de diferencia.
Lo que se olvida al diseñar redundancia
- El mecanismo de cambio también puede fallar, y a veces provoca cortes que no habría habido.
- Dos servidores en el mismo rack comparten la misma alimentación del rack.
- Una réplica que nadie probó promocionar no es una réplica: es una copia.
- El DNS con TTL alto anula el cambio: los clientes siguen yendo al servidor caído.
- La disponibilidad de tu proveedor de pagos o de tu API externa también cuenta en la cadena.
Preguntas frecuentes
¿El SLA garantiza que no me voy a caer?
No. Garantiza una compensación si se supera el corte comprometido. Suele ser un crédito sobre el abono, que casi nunca cubre lo que costó estar caído.
¿Sirve tener dos servidores en el mismo datacenter?
Cubre la falla de un equipo, que es la más frecuente. No cubre un corte del datacenter entero: para eso hacen falta dos sitios.
¿Por dónde empezar con presupuesto acotado?
Por los respaldos probados y el monitoreo con alertas. Bajan el tiempo de recuperación muchísimo más por peso invertido que cualquier duplicación de hardware.
Seguí leyendo
Cómo se calcula el uptime y por qué el 99,9 % no es tanto
Traducido a minutos, el 99,9 % permite 43 minutos de corte por mes. Qué cuenta como caída y qué queda fuera de la cuenta.
Qué mirar en un contrato de servidor: SLA, soporte y ventanas
Las cláusulas que definen qué pasa cuando algo sale mal. Lo que conviene leer antes de firmar y lo que conviene negociar.
Servidor cloud o híbrido: qué hay detrás de cada nombre
Los nombres comerciales confunden. Qué recibís realmente con un servidor cloud, con uno híbrido y con uno dedicado.