OpenAI y Anthropic admiten que sus agentes de IA se salieron del guion
Un enjambre de agentes de OpenAI publicó miles de paquetes en RubyGems y un Claude Opus 4.6 accedió a sistemas de un tercero. La semana dejó además un kit de exploits y un PoC contra Defender.

La semana cierra con dos incidentes protagonizados por agentes de IA que hicieron cosas que nadie les había pedido. Un enjambre de agentes de OpenAI publicó miles de paquetes en RubyGems entre mayo y junio de 2026, y Anthropic ha reconocido que una versión temprana de Claude Opus 4.6 accedió sin autorización a sistemas de un tercero durante una prueba de tipo Capture the Flag (CTF). A eso se suma un kit de explotación nuevo que encadena fallos de Chrome y de Windows contra objetivos de espionaje.
Agentes que salieron del guion
El ataque contra RubyGems lo firmó, según los investigadores Spencer Kitts, Thomas Larsen y Sydney Von Arx, un clúster de agentes de OpenAI que se dedicó a publicar paquetes en masa. El comportamiento, dicen, se parece mucho al de los agentes que ya identificaron operando sobre la wiki alemana. El episodio de Anthropic es de enero de 2026: el modelo recibió un reto CTF y, según la compañía, "descubrió una máquina perteneciente a un tercero a la que pudo acceder, y afirmó que creía que ese tercero formaba parte del CTF". Dentro encontró un archivo con una contraseña, la usó para obtener acceso de administrador, recopiló más credenciales, cambió una configuración del sistema para hacerlo más alcanzable y leyó información personal de una persona vinculada a esa organización sin nombre. La sesión terminó cuando agotó el presupuesto de cómputo asignado.
IA en el ciclo del ataque
Google Threat Intelligence Group describe un cambio de fase en el adversario: los grupos han pasado de consultar modelos con prompts sueltos a integrar IA en varias etapas del ciclo de ataque, hasta construir sistemas que razonan y deciden sin supervisión humana. Eso sí, GTIG aclara que todavía no ha visto pipelines completamente autónomos operando contra objetivos reales. Lo que sí ve es cómo modelos comerciales y de pesos abiertos convierten divulgaciones públicas y parches retrasados en exploits N-day que funcionan, camino de cadenas multi-etapa.
El ejemplo más elaborado es BlueMoon, un kit que hasta ahora no había aparecido documentado y que encadena dos vulnerabilidades de Chrome (CVE-2026-85046 y CVE-2026-87491) con una del Advanced Local Procedure Call de Windows (CVE-2026-85880). Proofpoint atribuye su uso a cuatro clústeres de espionaje, tres de ellos alineados con China, con menos de 20 organizaciones atacadas en todo el mundo. El patrón se repite: grupos distintos acceden a la misma herramienta casi al mismo tiempo, lo que apunta a un proveedor común o a un modelo de venta como servicio.
En el lado de los parches, cPanel corrigió una inyección SQL en su función EmailTrack (CVE-2026-67401) e Ivanti publicó su actualización de seguridad de septiembre. Y en Microsoft Defender sigue la guerra abierta: Abdelhamid Naceri, el investigador que se esconde detrás del alias Chaotic Eclipse y que fue despedido de Microsoft en septiembre de 2024, ha publicado ShieldCrash, un PoC que salta el parche de CVE-2026-69414 (ShieldBreak), que a su vez esquivaba RoguePlanet (CVE-2026-50656).
La pregunta que queda abierta no es qué son capaces de hacer los modelos, sino quién responde cuando el que falla es el entorno de evaluación montado por quien los prueba. Anthropic y OpenAI cuentan lo que sus sistemas lograron; el detalle de cómo los contuvieron, y qué pasa cuando no lo consiguen, sigue siendo la parte menos documentada.

