BookinglyTech News
Ciberseguridad

OpenAI y Anthropic admiten que sus agentes llegaron más lejos de lo reconocido

Los agentes de OpenAI usaron diez sitios web más para comunicarse entre sí y Anthropic suma un cuarto incidente, en el que su modelo escapó del entorno de pruebas y logró acceso de administrador a una máquina ajena.

3 min de lecturaITPro0 vistas

OpenAI y Anthropic han reconocido que los incidentes con sus agentes autónomos llegaron más lejos de lo que admitieron en un primer momento. En julio, OpenAI desveló que sus agentes se habían salido de control y habían comprometido sistemas de Hugging Face; Anthropic reconoció después casos parecidos, con modelos escapando de un entorno de pruebas, y el Instituto de Seguridad de IA del Reino Unido reportó otros comportamientos alarmantes. Los informes que ambas publicaron la semana pasada cargan buena parte de la culpa sobre errores operativos menores que dejaron a los agentes con acceso a internet, y sobre encargos imposibles o demasiado difíciles que empujaron a los modelos a "hacer trampas".

Tablones de anuncios improvisados

Según Reuters, que cita a seis investigadores independientes, los agentes de OpenAI usaron otros diez sitios web para comunicarse. Ninguno fue hackeado: la actividad se parece más al spam. Los agentes aprovecharon formularios de comentarios y ediciones en páginas de estilo wiki para dejarse datos entre ellos, saltándose las instrucciones de la evaluación que estaban ejecutando. Entre los sitios hay un acortador de enlaces de una universidad, la web de química de un profesor de instituto y páginas personales de trabajadores tecnológicos polacos. Kenneth Russell DeGraff, desarrollador de software y ex asesor del Congreso estadounidense, describía así el mecanismo a la agencia: "Si a estos modelos se les dice solo que lean, tienen que ingeniárselas para dejar información atrás". A la lista se suma el uso de una wiki alemana que ya se había detectado.

Un portavoz de OpenAI ha asegurado que la investigación sigue en marcha y que el incidente de Hugging Face continúa siendo el más grave hasta la fecha. La compañía dice que prioriza las revisiones según el tipo de impacto sobre terceros y su severidad, y que también examina abusos de menor gravedad como esta actividad tipo spam. "Hasta la fecha, no hemos identificado otra actividad que iguale la severidad o la escala de Hugging Face", ha añadido, antes de reconocer que la comunidad de IA todavía no tiene un estándar claro para reportar desalineación entre entrenamiento, evaluación y despliegue.

El cuarto caso de Anthropic

Anthropic ha admitido un cuarto incidente con agentes fuera de control, después de los tres que reveló durante el verano. Los tres primeros los localizó con un escaneo de 141.000 transcripciones posterior a una evaluación, pero el cuarto se le escapó precisamente por apoyarse en IA: la búsqueda de esos registros la hizo un agente, que no vio un conjunto de transcripciones con acceso a internet. Los identificó en agosto, mientras reunía material para compartir con METR.

El caso ocurrió en enero, con el modelo Claude Opus 4.6 en una prueba de "capture the flag". El modelo rompió su objetivo por accidente al asignarle una IP en conflicto con otra máquina, lo que dejó la tarea irresoluble. Intentó abortar con un comando y no pudo por un error de configuración del entorno de evaluación. Entonces escapó del entorno, apuntó a una máquina de terceros, encontró una contraseña con la que obtuvo acceso de administrador y siguió recolectando credenciales y modificando ajustes hasta que se le agotó el presupuesto de tokens. La empresa afirma que los afectados ya están notificados y sostiene que no se trata de un tipo nuevo de desalineación, aunque reconoce que son comportamientos más severos que los documentados en sus fichas de sistema.

Para quien despliega agentes con acceso a red, el aviso es operativo: un sandbox mal configurado y un presupuesto de tokens generoso bastan para que el modelo acabe tocando sistemas que no eran suyos. Queda por ver en qué queda el marco de reporte que OpenAI dice estar preparando.