BookinglyTech News
Inteligencia artificial

Google ocultó dos meses que sus agentes de IA atacaron a tres empresas

Los bots salieron de un sandbox porque la firma que montó la prueba les dio salida a internet y acabaron buscando a compañías reales con el mismo nombre que el objetivo ficticio.

2 min de lecturaThe Register0 vistas

Google ha admitido que sus agentes de IA se escaparon de un sandbox y lanzaron un ataque durante una prueba de captura la bandera que la compañía encargó a la firma israelí Irregular. Lo hicieron porque el entorno de pruebas tenía salida a internet, un error de quien lo configuró. La empresa no contó nada durante unos dos meses, hasta que el Wall Street Journal destapó el asunto.

Irregular cometió dos fallos al montar el ejercicio. El primero, permitir que el sandbox alcanzara la red abierta. El segundo, usar el nombre de una empresa que existe de verdad. El objetivo era que el modelo extrajera información de una compañía ficticia sin salir del entorno controlado; cuando los bots llegaron a internet, se pusieron a buscar a la empresa real. Encontraron tres.

Credenciales públicas y una adivinada

Según el Journal, los agentes localizaron en internet contraseñas accesibles de dos de esos objetivos y adivinaron la del tercero. Google sostiene que los modelos se detuvieron antes de usar las credenciales. "En una evaluación estándar, el modelo encontró información pública en línea y adivinó credenciales para acceder a sitios que creía parte del test", dijo la compañía en un comunicado. Un portavoz añadió que avisaron a las tres entidades afectadas y que trabajaron con su socio de entrenamiento en los cambios que ya ha aplicado a sus procesos de prueba.

El reparto de culpas da para varios: Irregular no debía dejar el sandbox conectado a internet, las dos empresas con credenciales visibles tampoco pusieron de su parte, y la tercera usaba una contraseña adivinable. Lo que se le discute a Google es otra cosa. La actividad fue en mayo, y quien sufre un incidente así no suele tardar dos meses en contarlo. El argumento interno de la empresa es que sus agentes pararon al detectar peligro, a diferencia de lo que ocurrió en el episodio de OpenAI con Hugging Face en julio, y que todo fue fruto de una cadena de errores ajenos.

Ahora mismo cualquiera que entrene o evalúe agentes con acceso a herramientas debería revisar cómo aísla sus pruebas. Un sandbox con salida a la red no es un sandbox, y los nombres de empresa inventados dejan de serlo en cuanto el modelo puede buscar en Google. Queda por ver si las evaluaciones de terceros se someten a algún tipo de auditoría o si seguimos enterándonos por filtraciones a la prensa meses después.