BookinglyTech News
Ciberseguridad

Vulnerabilidad en LLM permite robar el razonamiento oculto

Una brecha en el cifrado de las trazas de razonamiento permite extraerlas con un modelo más débil, recuperando datos personales y credenciales.

2 min de lecturaSchneier on Security0 vistas

Investigadores han publicado un método para extraer el razonamiento paso a paso (chain-of-thought) de modelos de lenguaje propietarios como los de OpenAI, Anthropic o Google. Lo consiguen sin atacar directamente al modelo objetivo, sino aprovechando que los bloques de razonamiento cifrados que los proveedores envían al cliente son intercambiables entre sesiones, usuarios y modelos de su ecosistema. Al inyectarlos en un modelo más débil del mismo proveedor, este los descifra y los reproduce en texto plano.

La técnica, descrita en el paper 'Stealing Reasoning Traces from Proprietary LLM APIs', explota una brecha de diseño: en lugar de almacenar el razonamiento en el servidor, los servicios lo devuelven al cliente en bloques cifrados que este reenvía en cada petición. Como esos bloques son compatibles entre modelos del mismo proveedor, los atacantes pueden coger un bloque generado por un modelo fuerte y pedirle a un modelo débil que lo procese, forzándolo a decodificarlo.

Eso abre cuatro vías de ataque. La primera es eludir los mecanismos antidestilación: se puede extraer el razonamiento de modelos cerrados, algo que los autores demuestran con éxito en Anthropic, OpenAI y Google. La segunda es la extracción masiva de datos privados: muchos desarrolladores comparten registros de sesión en repositorios públicos sin saber que esos bloques cifrados contienen información sensible. Al rastrear repositorios, los investigadores descifraron 315.320 bloques y encontraron 367 datos personales identificables y 182 credenciales. La tercera es la filtración de información peligrosa que el modelo oculta deliberadamente: incluso cuando la respuesta final es segura, el razonamiento puede contener contenido prohibido que ahora queda expuesto. Y la cuarta es la inyección de prompts invisible: se pueden incrustar instrucciones maliciosas dentro de los bloques cifrados para contaminar implementaciones de agentes.

Los autores han notificado el problema a los proveedores y proponen mitigaciones a nivel criptográfico y de sistema, como firmar los bloques o enlazarlos a la sesión y al modelo.

La cuestión no es solo que se pierda el control sobre la propiedad intelectual del modelo: es que el mismo mecanismo de protección se convierte en un canal para extraer datos privados y ejecutar inyecciones invisibles. Si los exponentes de agentes confían en esos bloques cifrados para ocultar su lógica, ahora tienen una superficie de ataque más.

Ataque roba razonamiento de LLM propietarios · Bookingly