High Availability
Alta disponibilidad
¿Qué es?
La disponibilidad es un concepto evidente que, lamentablemente, los responsables de TI suelen pasar por alto. En pocas palabras, los equipos de su sala de servidores o centro de datos deben permanecer en línea y accesibles el mayor tiempo posible. La alta disponibilidad (HA) es un término técnico que describe los sistemas que ofrecen más tiempo de actividad (o menos tiempo de inactividad) que el promedio del sector. En la era digital, la alta disponibilidad se está convirtiendo en un requisito estándar para los equipos de TI, ya que prácticamente todo está conectado a Internet o al IoT.
La disponibilidad debe contemplarse desde las etapas iniciales de planificación y presupuesto. A menudo es necesario adquirir subsistemas y componentes redundantes para mitigar los riesgos y minimizar el tiempo de inactividad, aunque esto incremente los costos. Es necesario eliminar los puntos únicos de falla (SPOF). También debe prepararse un plan de continuidad del negocio (BCP) para hacer frente a interrupciones importantes. Este plan debe describir cómo pueden continuar las operaciones durante una interrupción, cómo reanudar las operaciones normales lo antes posible (lo que en ocasiones se denomina plan de recuperación ante desastres, DRP) y cómo se verá afectado el negocio como consecuencia de la interrupción (lo que en ocasiones se denomina análisis de impacto al negocio, BIA).
La disponibilidad debe contemplarse desde las etapas iniciales de planificación y presupuesto. A menudo es necesario adquirir subsistemas y componentes redundantes para mitigar los riesgos y minimizar el tiempo de inactividad, aunque esto incremente los costos. Es necesario eliminar los puntos únicos de falla (SPOF). También debe prepararse un plan de continuidad del negocio (BCP) para hacer frente a interrupciones importantes. Este plan debe describir cómo pueden continuar las operaciones durante una interrupción, cómo reanudar las operaciones normales lo antes posible (lo que en ocasiones se denomina plan de recuperación ante desastres, DRP) y cómo se verá afectado el negocio como consecuencia de la interrupción (lo que en ocasiones se denomina análisis de impacto al negocio, BIA).
¿Por qué la necesita?
Dado que gran parte de la vida moderna está conectada al IoT, los equipos de TI deben diseñarse para ofrecer una alta disponibilidad. En el caso de la computación en la nube, los proveedores de servicios en la nube (CSP) deben garantizar que sus servicios estén siempre disponibles. En proyectos de investigación importantes, la disponibilidad de los equipos puede ser clave para lograr avances científicos sin precedentes. En el futuro, cuando las soluciones para ciudades inteligentes, como los vehículos autónomos, lleguen a las calles, la alta disponibilidad será necesaria para mantener en funcionamiento el mundo inteligente del futuro.
¿Cómo ayuda GIGABYTE?
Las soluciones de servidores de GIGABYTE ofrecen las siguientes funciones para garantizar una alta disponibilidad:
a. Gestión y protección inteligente ante crisis (SCMP): SCMP es una función patentada por GIGABYTE que se implementa en servidores con diseños de fuentes de alimentación (PSU) no totalmente redundantes. Con SCMP, si ocurre una falla en una PSU o el sistema se sobrecalienta, el sistema fuerza al CPU a entrar en un modo de consumo de energía ultrabajo, lo que reduce la carga de energía y evita apagados inesperados.
b. Continuidad inteligente (SmaRT): Para evitar la interrupción del servicio del servidor y la pérdida de datos como consecuencia de una falla de energía, GIGABYTE ha implementado SmaRT en todas sus plataformas de servidores. Cuando ocurre una interrupción del suministro eléctrico, el sistema reduce su rendimiento mientras mantiene la disponibilidad y disminuye la carga de energía. Los capacitores dentro de la fuente de alimentación pueden suministrar energía durante diez a veinte milisegundos, tiempo suficiente para cambiar a una fuente de energía de respaldo y continuar en funcionamiento.
c. Arquitectura de ROM dual: Si la ROM que almacena el BMC y el BIOS no logra iniciar, el sistema se reinicia con el BMC o el BIOS de respaldo. Una vez actualizado el BMC principal, la ROM del BMC de respaldo se actualiza automáticamente mediante sincronización. En el caso del BIOS, puede actualizarse según la versión de firmware que el usuario elija.
a. Gestión y protección inteligente ante crisis (SCMP): SCMP es una función patentada por GIGABYTE que se implementa en servidores con diseños de fuentes de alimentación (PSU) no totalmente redundantes. Con SCMP, si ocurre una falla en una PSU o el sistema se sobrecalienta, el sistema fuerza al CPU a entrar en un modo de consumo de energía ultrabajo, lo que reduce la carga de energía y evita apagados inesperados.
b. Continuidad inteligente (SmaRT): Para evitar la interrupción del servicio del servidor y la pérdida de datos como consecuencia de una falla de energía, GIGABYTE ha implementado SmaRT en todas sus plataformas de servidores. Cuando ocurre una interrupción del suministro eléctrico, el sistema reduce su rendimiento mientras mantiene la disponibilidad y disminuye la carga de energía. Los capacitores dentro de la fuente de alimentación pueden suministrar energía durante diez a veinte milisegundos, tiempo suficiente para cambiar a una fuente de energía de respaldo y continuar en funcionamiento.
c. Arquitectura de ROM dual: Si la ROM que almacena el BMC y el BIOS no logra iniciar, el sistema se reinicia con el BMC o el BIOS de respaldo. Una vez actualizado el BMC principal, la ROM del BMC de respaldo se actualiza automáticamente mediante sincronización. En el caso del BIOS, puede actualizarse según la versión de firmware que el usuario elija.