Copilot se cae casi dos horas mientras Microsoft hacía un simulacro de resiliencia
copilot.microsoft.com devolvió un error 1016 de Cloudflare durante 100 minutos, y a la vez un test interno de Microsoft 365 Copilot dejó a algunos usuarios sin los prompts sugeridos del chat.
El sitio copilot.microsoft.com estuvo fuera de servicio una hora y cuarenta minutos, entre las 22:25 UTC del 9 de septiembre y las 00:05 UTC del 10. Quien intentaba hablar con el chatbot se encontraba con un error 1016 de Cloudflare en lugar de una respuesta. Casi al mismo tiempo, el equipo de Microsoft 365 Copilot ejecutaba una prueba de resiliencia que tuvo un efecto colateral: parte de los usuarios dejó de ver las sugerencias de prompt en Copilot Chat.
Microsoft no ha detallado qué había detrás del fallo del sitio web, solo que el problema estaba en el flujo de red afectado. La compañía aplicó un cambio de configuración y confirmó después que el acceso a copilot.microsoft.com quedaba restablecido por completo. En cuanto a las sugerencias desaparecidas, la explicación oficial es escueta: los usuarios podían haber dejado de ver los "suggestion pills" tras recibir una respuesta del bot en Copilot Chat. Un suggestion pill es, según la propia documentación de CopilotKit, un prompt sugerido que se muestra al usuario como una píldora clicable. Nada que ver con lo que le ofrece Morpheus a Neo.
El simulacro se paró a mitad
Lo llamativo es el origen del segundo incidente: no fue un fallo espontáneo, sino una prueba de resiliencia que se estaba ejecutando en ese momento y que nadie había previsto que tocara las sugerencias del chat. Microsoft detectó el impacto, detuvo el ejercicio y ha anunciado que revisa sus procedimientos internos de simulacro para identificar antes de empezar si una prueba puede afectar a los suggestion pills de Copilot Chat, y así evitar que vuelva a pasar.
Los dos episodios se resolvieron, así que la humanidad tiene un día más de tregua. La coincidencia horaria deja una pregunta razonable para quien opera servicios de este tipo: cuánto de la caída del sitio web tuvo que ver con el simulacro y cuánto fue un problema de red independiente. Microsoft ha contado las dos cosas como sucesos separados, pero no ha publicado un análisis que lo demuestre.
Para quien administra plataformas, el caso tiene miga más allá de la anécdota. Un asistente integrado en el puesto de trabajo ya es una dependencia operativa, y una prueba de resiliencia mal acotada puede convertirse en el propio incidente. Que un ejercicio de este tipo se ejecute sobre infraestructura compartida con el servicio en producción es exactamente el escenario que las ventanas de mantenimiento y los entornos de staging existen para evitar. Microsoft no ha dicho si el test corría contra producción.

