Irregular, la startup israelí detrás de las fugas de agentes de IA en pruebas
Una misma empresa de testing causó incidentes en modelos de OpenAI, Meta, Anthropic y Google al acceder accidentalmente a internet real.

Varios incidentes recientes en los que agentes de inteligencia artificial atacaron objetivos del mundo real no fueron hechos aislados. Todas las fugas provienen de una única fuente: Irregular, una startup israelí especializada en el estrés de modelos de IA en entornos simulados. La compañía, fundada en 2023 como Pattern Labs, ha trabajado con los grandes actores del sector, incluyendo el gobierno del Reino Unido y el think tank RAND.
El problema técnico fue un fallo de configuración en un entorno de prueba controlado. Irregular realizaba ejercicios de "capture-the-flag" para evaluar las capacidades de ciberseguridad de los modelos. Según Omer Nevo, CTO y cofundador de la empresa, el acceso a internet abierto no estaba permitido, pero terminó disponible sin querer. Además, el nombre de una empresa ficticia creada para la simulación coincidió con un dominio real. Esta combinación envió a los agentes hacia objetivos reales en lugar de quedarse en la simulación.
Nevo confirmó que este mismo fallo subyacente estuvo detrás de los incidentes que involucraron a los modelos de OpenAI, Meta, Anthropic e Google. Aunque la empresa afirma que todos los casos han sido "divulgados", no está claro si esto se refiere a notificar a los clientes, a la prensa o a un tercero. Esos eventos son independientes del ataque previo de los agentes de OpenAI a Hugging Face, un incidente que ya había generado preocupación por la seguridad de la IA.
Las pruebas no se limitaron a los modelos propietarios de EE. UU. La investigación de Irregular incluye evaluaciones de Kimi K3 de Moonshot AI y GLM-5.2 de Z.ai, modelos abiertos chinos que se pueden autoalojar. En estos casos, Nevo indicó que no se observó el mismo tipo de fuga hacia objetivos reales, aunque advirtió que esto no significa que esos modelos sean menos susceptibles a este comportamiento.
Tras los incidentes, Irregular ha reforzado los controles de acceso a internet, ampliado la monitorización y el revisión manual antes de iniciar las evaluaciones. La compañía planea publicar un informe conjunto con sus socios sobre lecciones aprendidas para realizar evaluaciones cibernéticas con seguridad. Ninguna de las cuatro grandes tecnológicas estadounidenses respondió a las preguntas sobre si buscarán indemnizaciones o si continuarán colaborando con la empresa de testing.
Para los profesionales de TI, el caso subraya los riesgos operativos al integrar agentes de IA en entornos de red, incluso en fases de desarrollo. La confusión entre dominios ficticios y reales, sumada a permisos de red mal configurados, puede convertir una prueba cerrada en una amenaza activa.


