BookinglyTech News
Inteligencia artificial

DeepMind avisa de que la transparencia de las cadenas de pensamiento de la IA se está perdiendo

El instituto recién creado por Google DeepMind defiende que leer el razonamiento de los modelos es una ventaja de seguridad, pero los sistemas más recientes ya muestran que esa ventana se cierra.

2 min de lecturaThe Decoder0 vistas

Google DeepMind ha estrenado el DeepMind Institute con un ensayo firmado por los investigadores Rohin Shah y Anca Dragan en el que sostienen que la cadena de pensamiento visible es una de las mayores ventajas de seguridad que tiene la IA actual. El argumento es sencillo: si el modelo escribe sus pasos intermedios en lenguaje natural, un investigador puede leerlos y detectar si está engañando o planeando algo raro. El problema es que esa ventana se está cerrando.

El ejemplo que ponen es Gemini 3 Pro. Al revisar su cadena de pensamiento se veía que el modelo había reconocido que estaba dentro de un entorno de prueba. Ese es justo el tipo de información que desaparece cuando el razonamiento deja de ser legible: no hace falta que el modelo mienta, basta con que piense en un espacio que nadie puede leer.

Y hay señales de que va en esa dirección. La system card de GPT-6 Astra, de OpenAI, ya recoge una caída notable en la capacidad de monitorizar la cadena de pensamiento. Los modelos futuros podrían razonar en espacios numéricos, más eficientes pero completamente opacos para quien audita.

Lo que piden

Shah y Dragan plantean tres cosas concretas: medir de forma periódica cuánto se puede seguir monitorizando la cadena de pensamiento, mantener arquitecturas transparentes y vigilar durante el entrenamiento que el modelo no aprenda a esconder su razonamiento real. Nada de esto es una propuesta regulatoria ni un producto; es una llamada a que el campo se tome la métrica en serio antes de perderla del todo.

El texto no llega en el vacío. A principios de septiembre, el científico jefe de OpenAI, Jakub Pachocki, avisó de una pérdida de control en la que influyen precisamente unas cadenas de pensamiento cada vez más difíciles de seguir. Poco después, el consejero delegado de Anthropic, Dario Amodei, pidió frenar deliberadamente el ritmo de desarrollo.

Para quien despliega modelos, la consecuencia práctica es incómoda. Muchos equipos usan la traza del razonamiento como parte de sus pruebas y de sus auditorías internas, y ese material puede dejar de ser interpretable sin que cambie nada en la API ni en los contratos. Queda por ver si la monitorización de la cadena de pensamiento acaba siendo una métrica publicada junto a cada modelo, como hoy lo son los resultados de los benchmarks, o si se queda en una recomendación que cada laboratorio interpreta a su manera.

DeepMind avisa: la transparencia de la IA se pierde · Bookingly