OpenAI y Anthropic sufren interrupciones simultáneas en sus modelos de IA
Los modelos frontier de OpenAI, Anthropic y xAI reportaron caídas el jueves por la mañana, sin que se confirmara una causa común. Los incidentes afectaron a ChatGPT, Codex, Claude y Grok.
.gif)
Los modelos frontier de Anthropic, OpenAI y xAI experimentaron interrupciones raras el jueves por la mañana, provocando tiempos de inactividad en sus chatbots. SpaceX, la empresa matriz de xAI, explicó que el problema de Grok se originó en un "outage" en su centro de cómputo de Memphis.
Los incidentes coincidieron, lo que sugiere que podrían haber sido causados por un proveedor de servicios de terceros compartido, aunque ni OpenAI ni Anthropic confirmaron ninguna fuente externa. SpaceX no respondió a las solicitudes de comentario, pero se disculpó públicamente con sus socios de cómputo.
OpenAI informó que un error de enrutamiento a partir de las 7:43 a.m. PT dejó a ChatGPT y Codex indisponibles para algunos usuarios en diversas plataformas. Se implementó una solución a las 8:17 a.m. PT y el servicio sigue siendo monitoreado.
Anthropic registró una "outage parcial" a las 6:23 a.m. PT, con errores elevados en las peticiones a Claude Mythos 5.1, Claude Fable 5.1 y Claude Opus 5. La compañía identificó la causa y desplegó una corrección, marcando el problema como resuelto a las 9:16 a.m. PT. Claude Sonnet 5 también experimentó breves problemas después de las 9 a.m. PT.
xAI informó una caída de Grok en todas sus plataformas a las 6:30 a.m. PT, publicando "investigating outage" en su página de estado. La interrupción se completó a las 10:05 a.m. PT, con la confirmación de que el tráfico estaba sano nuevamente.
Hubo reportes esporádicos de una posible caída de Google Gemini el mismo día, pero Google no confirmó incidentes ni registró nada en su panel de estado.
En la mayoría de los casos, múltiples caídas simultáneas en el sector indican problemas con un proveedor de nube, CDN u otro tercero. Sin embargo, OpenAI y Anthropic no señalaron una causa compartida, y los principales actores de infraestructura como Cloudflare, Amazon Web Services y Microsoft Azure no reportaron interrupciones.
Para los administradores de sistemas y arquitectos, el evento subraya la necesidad de diversificar la infraestructura de cómputo y establecer planes de contingencia robustos. La falta de información pública sobre la raíz del problema también resalta la importancia de mantener canales de comunicación claros con los socios de servicios de terceros.
En el horizonte, se espera que los proveedores de modelos AI implementen medidas de redundancia más estrictas y ofrezcan mayor transparencia sobre sus dependencias de infraestructura para evitar interrupciones similares en el futuro.
