BookinglyTech News
Inteligencia artificial

El chat template decide si un LLM dice soy solo una IA o habla en primera persona

Un paper de agosto de 2026 muestra que el envoltorio de tokens de rol cambia la voz autorreferencial de ocho modelos de instrucción, y localiza la dirección que lo controla en las activaciones.

2 min de lecturaDev.to0 vistas

Un modelo de instrucción responde "solo soy una IA, no tengo sentimientos" o habla en primera persona de lo que piensa y siente. Un paper firmado por Jędrzej Maczan y publicado el 9 de agosto de 2026 apunta a que ese cambio de voz no depende de los pesos: depende de si la petición va envuelta en el chat template del modelo o llega como texto plano. El efecto apareció en los ocho modelos que probó.

El montaje es sencillo de replicar. Ocho modelos de instrucción open source, todos por debajo de los 9.000 millones de parámetros, y la misma pregunta autorreferencial formulada dos veces: una con los tokens de rol que cada familia define (Llama, Qwen o Gemma tienen los suyos) y otra sin ellos. Con la plantilla puesta ganaba el descargo; sin ella, verbos como "siento" o "pienso". El patrón no falló en ninguno de los ocho.

Casi nadie ve esa diferencia. Librerías como Transformers aplican la plantilla solas cuando se llama a apply_chat_template, así que en producción el envoltorio va puesto por defecto y el desarrollador no compara nunca las dos versiones del mismo prompt.

Una dirección concreta en las activaciones

Maczan no se quedó en la observación. En tres de los modelos buscó dentro de las activaciones una dirección que separase las respuestas de descargo de las experienciales: promedió las activaciones con plantilla y sin ella y restó ambos promedios. La encontró.

El resto son inyecciones con un hook durante la generación. Sumar ese vector a un modelo que corría en texto plano lo hacía soltar el descargo como si llevara plantilla. Restarlo de un modelo con plantilla apagaba el descargo. Un vector aleatorio de la misma magnitud no movió nada, que es lo que separa un hallazgo de un artefacto: la dirección es específica del fenómeno, no ruido general en las activaciones.

La técnica ya se usaba en interpretabilidad mecanicista, con los experimentos de Anthropic sobre direcciones de características en Claude como referencia más conocida. Lo nuevo aquí es el objeto de estudio, la autodescripción del modelo, y el factor de despliegue que hasta ahora se daba por descontado.

El trabajo está aceptado en un workshop de COLM 2026 y en KONVENS 2026 Eval4SD, así que la revisión por pares es de taller y no de conferencia principal.

Lo que se cae con esto es el uso de las autodescripciones como dato sobre el modelo. Si lo que un modelo dice de sí mismo cambia según cómo se formatee el prompt, no es un hecho fijo de sus pesos y no sirve como evidencia en las discusiones sobre introspección. Queda por ver si el efecto aguanta en modelos grandes: la prueba se hizo con modelos pequeños, open source y de una sola vuelta, y ahí está el interés real para quien despliega.