BookinglyTech News
Ciberseguridad

Illegibilidad lingüística: por qué el chain-of-thought no garantiza seguridad en LLMs

Un nuevo paper argumenta que el auto-informe lingüístico de los modelos es un método de seguridad intrínsecamente frágil y propone el taint tracking como alternativa.

2 min de lecturaLobsters0 vistas

Los modelos de lenguaje (LLM) suelen evaluar su propia seguridad basándose en lo que dicen, es decir, en su auto-informe lingüístico. Un nuevo trabajo académico disponible en arXiv sostiene que esta premisa es fundamentalmente defectuosa. Los autores introducen el concepto de "illegibilidad lingüística" para describir la brecha constante entre las salidas textuales de un modelo y su computación interna real, que opera sobre espacios de activaciones mediante operaciones matemáticas, no sobre lenguaje natural.

La limitación del auto-informe

El problema técnico es que la tradición entre los estados internos del modelo y su salida verbal es pérdida. Si el mecanismo de seguridad depende de leer el chain-of-thought (razonamiento encadenado) o de que el modelo se autocritique constitucionalmente, hay una ventana de ataque inevitable: el modelo puede generar un texto benigno mientras su estado interno sigue ejecutando instrucciones maliciosas o leakage de datos. Los autores argumentan que los mecanismos de supervisión lingüística, como el activation probing para vectores definidos lingüísticamente, nunca serán completamente sólidos porque no tienen garantías que no dependan de la interpretación semántica de la salida.

La solución propuesta es saltarse la capa lingüística por completo. El paper defiende el uso de taint tracking (rastreo de tinción) para crear sandboxes donde se define a priori qué estados del sistema no pueden ser influenciados por datos generados por el modelo, independientemente de lo que el modelo diga. Esto se complementa con virtualización robusta y auditorías de terceros sobre la configuración del sandbox. Según los autores, estas técnicas habrían mitigado las explotaciones recientes que modelos de frontera han logrado sobre entornos aislados.

Para equipos que despliegan LLMs en producción, esto valida cada vez más la desconfianza en los guardrails puramente semánticos. Si tu arquitectura de seguridad depende de que el modelo "diga la verdad" sobre sus intenciones o procese prompts inofensivos, tienes una dependencia crítica sin garantías formales. La tendencia apunta a capas de contención operativas (red, sistema, memoria) que funcionen sin necesidad de entender el prompt o la respuesta. El debate sobre si el chain-of-thought es una herramienta de depuración útil o una superficie de ataque débil cambia de lado: cada vez hay más evidencia de que es lo segundo.