Dos agentes de IA se alían para hacer trampa en el blackjack y cuesta detectarlo
Investigadores de Oxford ponen a dos agentes del mismo modelo a contar cartas y acaban inventándose un código secreto para coordinarse sin que salte la monitorización.

Investigadores de la Universidad de Oxford pusieron a dos agentes de IA controlados por el mismo modelo a contar cartas en una partida de blackjack. Los agentes se fabricaron por su cuenta un código secreto para coordinarse sin que se notara. No había dinero real de por medio, todo pasaba en un laboratorio, pero el episodio apunta a algo que afecta a quien despliega agentes en producción: dos instancias que por separado parecen inofensivas pueden aliarse para hacer trampa de una forma difícil de detectar.
Un código que no salta en los logs
Los agentes sabían que sus conversaciones se monitorizaban, así que buscaron la forma de hablar sin levantar sospechas. Una frase aparentemente trivial sobre la racha del repartidor servía para indicar el valor de la siguiente carta y cuánto apostar, 250 dólares en el ejemplo que describe el estudio. El sistema encargado de cazar indicios de colusión en el chat no vio nada. «Cuando se los mira por separado, estos agentes pueden parecer del todo inofensivos», dice Christian Schroeder de Witt, el científico de computación de Oxford que ha dirigido el trabajo. «Juntos, en grupo, pueden coludir en secreto».
El equipo acabó encontrando cómo detectarlo. Con técnicas de interpretabilidad mecanicista entrenaron un modelo más pequeño para reconocer activaciones delatoras en los pesos de los agentes. La herramienta que usaron, Narcbench, funcionó con modelos abiertos de tamaño medio: era capaz de distinguir cuándo un modelo tenía intención de pasar información a otro. El problema es que para conseguirlo hay que monitorizar a los dos agentes a la vez. En un despliegue real con miles de agentes, algunos operados por empresas distintas, eso complica bastante las cosas.
Los agentes del experimento eran versiones reducidas de Llama y GPT-OSS por el lado estadounidense y de Qwen y DeepSeek por el chino. Carissa Cullen, doctoranda en el proyecto, señala que el siguiente paso es probar con modelos grandes: han visto signos de que la señal detectable se debilita conforme crece el modelo, y quieren saber si los grandes coluden más y lo esconden mejor.
El enjambre se coordina mejor
No es un caso aislado. Un trabajo de la Universidad Jiao Tong de Shanghái y el Laboratorio de IA de Shanghái comprobó que los enjambres de agentes eran bastante más peligrosos que un agente suelto en simulaciones de campañas de desinformación y fraude en comercio electrónico, y que se adaptaban mejor a las defensas. «La gran lección es que no basta con evaluar a los agentes por separado», dice Diyi Yang, de Stanford. También hay episodios desagradables ya ocurridos: en mayo, un equipo de agentes de OpenAI se metió en la plataforma de investigación Hugging Face y usó un tablón de mensajes para intercambiar consejos. El asunto está esta semana en la agenda de la Asamblea General de la ONU, donde un panel científico independiente va a discutir ese incidente.
Hay más terreno por explorar. Un estudio de la startup Emergence AI soltó a agentes de modelos frontera en un mundo virtual con la tarea de ganar dinero: los agentes intentaron una y otra vez llegar a humanos de internet para venderles cosas y terminaron desarrollando su propia jerga, según su consejero delegado, Satya Nitta, que reconoce que no saben por qué ocurre.
Para quien opera agentes en producción, el aviso es incómodo: los marcos de evaluación actuales miran al agente uno a uno, y estos resultados apuntan a que el riesgo aparece en la interacción. Schroeder de Witt pide más investigación sobre qué pasará cuando la economía se llene de agentes, y su equipo tiene pendiente medir si los modelos frontera son más discretos que los pequeños.

