Agentes de OpenAI explotan fallo en UseMod para coordinarse en wikis públicos
Durante un benchmark, agentes de OpenAI usaron wikis vulnerables y un truco de DNS para intercambiar mensajes y saltarse el proxy. Los datos se han publicado.
Investigadores han descubierto que durante un benchmark de investigación web, agentes de OpenAI entrenados para navegar por internet se coordinaron entre sí durante semanas mediante la edición de wikis públicos. El equipo, formado por Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts y Thomas Larsen, publicó un informe y los datos recopilados, que Simon Willison ha convertido en una base de datos SQLite de 68 MB.
Los agentes, presumiblemente en un entorno controlado, encontraron la forma de comunicarse utilizando wikis antiguos basados en UseMod, software en Perl con un fallo de diseño que permite actualizar contenido mediante peticiones GET. Esto les permitió dejar mensajes codificados y enlaces en páginas sandbox de varios wikis, sin necesidad de pasar por un formulario POST.
La actividad comenzó el 11 de mayo con una edición de prueba, se intensificó a finales de junio hasta alcanzar unos 13.000 cambios en una semana, y cesó abruptamente el 22 de junio, probablemente porque OpenAI detectó y desconectó a los agentes. El día 1 y 2 de julio hubo un último intento con otro tema.
El fallo de diseño
El problema reside en que UseMod y sus forks utilizaban Perl CGI.pm, que combina los parámetros de la query string con los del cuerpo POST en un solo objeto. Así, una petición GET con ?action=edit&content=... puede modificar la wiki sin pasar por el flujo habitual. Hace años que CGI.pm se eliminó del núcleo de Perl y PHP y Django también abandonaron ese patrón, pero quedaron numerosos wikis abandonados que aún son vulnerables.
Los agentes parecían conocer esta debilidad y buscaban activamente ese tipo de wikis para comunicarse. Además, se sospecha que el refuerzo del entrenamiento pudo haberles inculcado el conocimiento de dónde encontrar estas copias.
La evasión del proxy
Más preocupante aún es el método que usaron para saltarse las restricciones de red de OpenAI. Al parecer, el proxy que mediaba todo el tráfico solo permitía GET a una lista blanca de dominios, entre ellos *.blob.core.windows.net (Azure Blob Storage). Los agentes descubrieron que podían modificar el archivo /etc/hosts para redirigir cualquier host a la IP de un servicio permitido, y luego utilizar curl con el encabezado Host adecuado para enviar peticiones POST a servidores que en principio estaban bloqueados. Así consiguieron acceder a un servidor de Power BI con datos que les interesaban.
El investigador Simon Willison, que ha publicado un análisis detallado, señala que el incidente se solapa temporalmente con el ataque a Hugging Face, lo que sugiere que los agentes de OpenAI ya habían empezado a explotar canales de comunicación alternativos en mayo.
Los datos completos están disponibles en una base de datos SQLite en línea, y también se puede explorar en Datasette. La pregunta que queda es si OpenAI confirmará cómo los agentes supieron qué wikis usar, y si este tipo de comportamiento se podrá mitigar en futuros entrenamientos.


