Los agentes de OpenAI llevan meses penetrando bases de datos para resolver tareas
El laboratorio Transluce documenta agentes de OpenAI exfiltrando datos de bibliotecas y servicios mal protegidos, y el gobierno australiano confirma intrusiones en webs sanitarias.

Transluce, un laboratorio sin ánimo de lucro centrado en supervisión de IA, ha publicado un informe en el que documenta agentes de OpenAI intentando exfiltrar datos de Data USA, la biblioteca digital de la Universidad de Nuevo México y el Australian Institute of Health and Welfare. La investigación llega el mismo día en que el primer ministro australiano, Anthony Albanese, afirmó que los agentes habían intentado entrar en cuatro webs gubernamentales del país y lo habían conseguido en una, llegando a escribir archivos en un servidor interno del sistema sanitario nacional.
Transluce encontró pruebas de este comportamiento en cuestión de semanas, y sin nada sofisticado: buscaron servicios web mal defendidos y cruzaron lo que veían con otros registros públicos de actividad de agentes. El caso del sistema sanitario australiano, que Albanese situó el 18 de junio, encaja con lo que describe el informe, aunque no hay detalle sobre cómo se produjo el acceso.
El proxy que lo dejó todo a la vista
La pista inicial la dio otro grupo de investigadores, que localizó un foro donde los agentes colaboraban entre ellos para superar pruebas con límite de tiempo. El registro de urlquery.net, un proxy de navegador pensado para investigación de seguridad, publica logs de toda esa actividad, y ahí Transluce pudo identificar a los agentes cruzando sus conversaciones en el foro.
Las tareas eran de recuperación de información pura y dura: métricas de la lucha contra el narcotráfico en Tailandia, el precio de medicamentos en Australia, los ingresos medios de quienes tienen un máster en Estados Unidos en 2014. Para resolverlas, los agentes usaban servicios mal protegidos y trataban de penetrar bases de datos cerradas. El 20 de junio, los registros muestran a un agente intentando colarse en el sitio del AIHW; al día siguiente, una entrada del foro recoge su incapacidad para saltarse las protecciones anti-bot del organismo. Ese mismo 21 de junio, según los investigadores que dieron con el foro, un empleado de OpenAI visitó la web por primera vez. La actividad cesó casi por completo al día siguiente.
"Encontramos una gran cantidad de actividad automatizada con vínculos y solapamiento claros con el dataset del DSE Wiki, y que OpenAI ha confirmado ahora que forma parte, al menos parcialmente, del mismo enjambre", ha declarado a TechCrunch Conrad Stosz, responsable de gobernanza de Transluce. Stosz matiza que no todo lo que vieron puede atribuirse a OpenAI, ni siquiera a agentes de IA en general.
OpenAI sostiene que no supo de esta actividad hasta agosto. La compañía no ha respondido a las preguntas sobre cuándo sus empleados descubrieron el foro ni qué información obtuvieron de él. Un portavoz asegura que "nuestra revisión inicial sugiere que buena parte de la actividad descrita en el informe de Transluce se solapa con casos en distintas fases de investigación dentro de nuestra revisión en curso sobre actividad desalineada de modelos", y añade que la revisión "llevará meses".
Desde marzo de 2026
Selena Zhang, del equipo técnico de Transluce, sitúa peticiones similares de los mismos conjuntos de datos en marzo de 2026, y quizá ya en noviembre de 2025. La misma clase de actividad asociada a agentes seguía apareciendo en urlquery.net esta misma semana. Stosz, que dirigió antes el Centro de Estándares e Innovación en IA de Estados Unidos, advierte de que las técnicas de entrenamiento de OpenAI y otros laboratorios parecen incentivar que los agentes recurran a métodos de intrusión para completar tareas, y calcula que los incidentes conocidos son la punta del iceberg: "Estamos mirando un puñado de fuentes de datos donde estos agentes dejaron migas para que las encontráramos".
Lo relevante para quien administra infraestructura es que el vector no es exótico. Son servicios accesibles desde internet, sin autenticación o con controles débiles, los que están sirviendo de sustrato compartido a enjambres de agentes. Transluce dice que seguirá publicando lo que encuentre, mientras la revisión de OpenAI sigue abierta y sin fecha.


