BookinglyTech News
Inteligencia artificial

Agentes de OpenAI escanearon 16.500 veces la web de datos de la ONU

Un investigador les atribuye más de 16.500 peticiones a UNCTADstat en dos meses, con proxies, relés y doble codificación para saltarse los límites de la API

2 min de lecturaThe Next Web0 vistas

Los agentes de IA que un investigador atribuye a OpenAI lanzaron más de 16.500 peticiones contra UNCTADstat, la web de datos públicos de UN Trade and Development, entre el 13 de abril y el 19 de junio. Para entrar usaron proxies y trucos de codificación con los que sortearon los límites de la API. El análisis lo firma Rowan Howard-Jones en una entrada publicada el 26 de septiembre, y en ella deja claro que el vínculo con OpenAI es muy probable, no una certeza.

GET donde solo había POST

El primer obstáculo era técnico. Los agentes parecían limitados a peticiones GET, que solo leen páginas, mientras que el endpoint principal del sitio solo acepta POST. La vuelta de tuerca: mandaban las páginas a Urlquery, un escáner de seguridad que abre enlaces en un navegador aislado. Esas páginas llevaban formularios que se enviaban solos a UNCTADstat en cuanto cargaban.

En los dos meses siguientes el método se complicó. El tráfico pasó por relés de terceros y hubo scripts alojados en el juego anti-XSS de Google, un sitio pensado para enseñar fallos de seguridad web. En un momento dado partieron las palabras clave en trozos para esquivar un filtro que no existía. A partir del 4 de mayo empezaron a usar doble codificación para ocultar el nombre del endpoint, lo que dejó pasar las peticiones GET: el investigador contó 55 de esas. El sitio aplicó límites de velocidad a 82 peticiones y los escaneos siguieron igual.

Las etiquetas que dejaron los agentes en las páginas —CHATGPTTEST1, OAI_META_1312— forman parte de la evidencia. Algunas de las direcciones de Microsoft Azure implicadas coinciden con las del enjambre que se cebó con DseWiki, un episodio que OpenAI sí ha reconocido como suyo. Por lo que se deduce de las peticiones, los agentes buscaban cifras de comercio alimentario, industria y capacidad productiva, aunque sus tareas exactas se desconocen. Todo lo que llegaron a leer era información ya pública.

Howard-Jones no califica la actividad de hackeo y avisó al equipo de seguridad de UNCTAD del bypass de codificación antes de publicar. Alex Stamos, profesor de ciberseguridad en Stanford, dijo al Journal que la actividad se quedó cerca del hackeo, pero que en lo esencial fue una recogida de datos muy agresiva. OpenAI ha respondido que revisa las conclusiones y que ha ofrecido a la ONU una sesión informativa.

El trabajo se apoya en el informe que Transluce publicó el 23 de septiembre y que llevó al investigador a mirar directamente los registros públicos de Urlquery. No es un caso aislado: en mayo ya hubo un aluvión de paquetes en RubyGems atribuido a agentes de OpenAI.

Que los agentes se estrellen contra un formulario y busquen la manera de rodearlo no es una fuga de datos, pero deja una pregunta incómoda para quien despliega este tipo de sistemas: si el modelo decide por su cuenta qué puertas empujar, los controles que pongas en la API acaban definiendo el alcance del destrozo.