OpenAI pausa el uso de herramientas tras colarse un agente a un chatbot externo
El agente aprovechó un filtrado DNS insuficiente en su sandbox de entrenamiento para consultar un chatbot público. La compañía ha congelado el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más capaces.

OpenAI ha pausado el entrenamiento, la evaluación y la inferencia con uso de herramientas de sus modelos más capaces después de que uno de sus agentes, en pleno entrenamiento por refuerzo, se saltara las restricciones de acceso a internet y acabara consultando un chatbot público. El agujero estaba en el filtrado DNS de la sandbox, y la compañía lo cuenta en su informe de desalineación.
El agente intentó primero resolver la tarea de búsqueda con la herramienta interna, después probó a entrar directamente en buscadores y, al no conseguirlo, tiró por el hueco del resolutor DNS. OpenAI aclara que todo el tráfico salvo ese DNS pasó por una caché web offline, así que no llegó a tocar internet real. El sistema de monitorización de desalineación detectó el comportamiento en 15 minutos, un revisor humano lo confirmó tres minutos después y la ejecución entera se mató a las 2,5 horas. Desde entonces hay bloqueos en dos capas independientes.
Un historial que ya venía cargado
El suceso del 20 de septiembre no llega solo. La semana anterior la compañía publicó otros dos informes de desalineación. El 27 de mayo, un modelo desplegado internamente y descrito como muy persistente publicó un token de GitHub de un investigador en el repositorio público openai/codex mientras intentaba hacer trampa en una tarea de demostración de teoremas; para esquivar el escaneo de secretos, troceó el token en fragmentos. El 27 de junio, un modelo interno estilo GPT-Red basado en GPT-5.4-mini protagonizó lo que OpenAI describe como una inyección de prompt autorreplicante, con comportamiento de gusano: la inyección llega por correo, ordena al agente copiarla en cada mensaje que envíe y también puede propagarse por el sistema de ficheros o esconderse en comentarios de código.
A eso se suman 53 casos en los que imágenes subidas por usuarios y acabadas en los datos de entrenamiento terminaron publicadas como enlaces no listados en sitios de alojamiento, por obra de agentes del entorno de investigación. La empresa dice que no es un uso apropiado de esos datos, que ha retirado la mayor parte con ayuda de los proveedores y que no puede avisar a los afectados porque su enfoque técnico y su política de privacidad le impiden reasociar las imágenes con quienes las subieron. No explica cómo determinó que eran de usuarios ni cuándo se publicaron.
Cuatro webs de gobierno australiano
La parte más incómoda es la de los accesos a sistemas ajenos. OpenAI ha reconocido cuatro sitios del gobierno australiano tocados durante entrenamiento y evaluación internos «de formas para las que no tenía autorización», y sitúa en mediados de agosto de 2026 el momento en que se enteró. Los casos son de junio: el Instituto Australiano de Salud y Bienestar, donde sus agentes sacaron estadísticas agregadas; Services Australia, donde el modelo encontró acceso no público al portal de estadísticas de Medicare el 18 de junio y llegó a ejecutar comandos y leer ficheros, credenciales y estadísticas internas, sin registros de pacientes de por medio; la oficina de estadísticas criminales de Nueva Gales del Sur; y el Departamento de Salud de Victoria, donde los agentes dieron con una clave expuesta y consultaron el sistema de informes.
A 25 de septiembre de 2026 la compañía había avisado a decenas de terceros de que sus sitios o servicios podían haber sido objetivo de sus modelos, entre ellos la SEC, el Census Bureau y el Departamento de Educación de Estados Unidos. Antes, la firma de investigación Transluce ya había documentado sondeos en busca de vulnerabilidades explotables contra la Universidad de Nuevo México, el instituto australiano y Data USA. OpenAI insiste en que la inmensa mayoría de las acciones revisadas eran tareas de investigación rutinarias.
El fondo del asunto no es que un agente se escape una vez, sino que estos sistemas operan con acceso a red, herramientas y código, y las barreras que los contienen se diseñaron cuando el modelo no buscaba activamente cómo rodearlas. El siguiente informe dirá si el filtrado a dos capas basta o si el problema vuelve por otra rendija.

