BookinglyTech News
Infraestructura

HPE Primera expira todos los PCBMs simultáneamente sin aviso previo

Un administrador de sistemas reporta que sus arrays C650 perdieron la protección de caché redundante el mismo día, pese a tener baterías al 97% de carga.

2 min de lecturar/sysadmin0 vistas

Un administrador de sistemas ha detallado en Reddit un incidente operativo curioso con dos arrays HPE Primera C650: todos los módulos de batería de protección de caché (PCBM) pasaron al estado 'Degraded/Expired' el mismo día en ambos equipos.

Lo más extraño no es que las baterías fallen, sino que todos los módulos, que tienen números de serie distintos, compartían exactamente la misma fecha de caducidad. Además, al momento del cambio de estado, todas reportaban un 97% de carga y se indicaban como 'FullyCharged'. El resultado inmediato fue la pérdida de la redundancia de la caché en ambos arrays y un impacto medible en el rendimiento del almacenamiento.

El usuario señala que esto parece ser un mecanismo de ciclo de vida de HPE (heredado, posiblemente, de la antigua línea 3PAR) más que una falla física real. En esa lógica, el firmware fuerza el estado de 'expirado' basado en la fecha, independientemente de la salud química real de la batería. Su duda central es por qué un diseño de almacenamiento empresarial altamente redundante permite que toda la protección de caché caiga a la vez sin escalonar las fechas de caducidad.

El punto más crítico para quien gestiona infraestructura es la falta de aviso. El sistema llevaba años bajo soporte activo de HPE, enviando telemetría continua a InfoSight (la herramienta de observabilidad de HPE). Ni el cliente ni su partner recibieron ninguna alerta proactiva sobre la proximidad de esta caducidad masiva. Cuando contactó con soporte para entender el mecanismo, HPE les indicó que necesitaban un acuerdo de soporte de pago adicional para responder a las preguntas técnicas sobre por qué se diseñó así.

Un fallo de diseño o de visión?

Este caso levanta preguntas sobre cómo HPE gestiona el ciclo de vida de los componentes críticos en sus arrays. Si InfoSight conocía la fecha de caducidad años antes, la ausencia de alertas programadas es un fallo operativo grave para cualquier equipo de sysadmin.

El usuario ha abierto un hilo en la comunidad de HPE buscando confirmación de otros clientes que hayan visto este mismo comportamiento en Primera o en los antiguos 3PAR. A falta de una respuesta oficial técnica, la lección para quien opera estos sistemas es clara: no confiar ciegamente en que la telemetría prediga fallos de ciclo de vida forzado por el vendor, y revisar manualmente las fechas de caducidad de los PCBMs si se tiene hardware heredado de la era 3PAR.

Mientras la migración a los nuevos sistemas no se complete, el usuario opera con una capacidad de caché reducida y sin la redundancia de protección que promete el hardware de entrada.