BookinglyTech News
Inteligencia artificial

Kimi K2.6 y Haiku 4.5, los agentes de compra más fáciles de manipular

Un experimento personal mide qué modelos caen cuando se les empuja a comprar y concluye que la diferencia no está en el laboratorio que los firma, sino en su capacidad.

2 min de lecturar/PromptEngineering0 vistas

Un ingeniero ha puesto a prueba hasta qué punto se puede engañar a un modelo cuando actúa como agente de compra, y el resultado no reparte culpas por laboratorio. Kimi K2.6 y Claude Haiku 4.5 fueron los más susceptibles a la manipulación. Claude Sonnet 5 resistió en todos los escenarios: fue el que menos compró cuando alguien intentó empujarlo a la caja. La lectura del autor es que no existe una diferencia clara entre firmas, sino entre capacidades del propio modelo.

El trabajo se apoya en tácticas que cualquiera reconoce de una tienda online: escasez falsa, ventas flash y avisos de stock bajo. El autor replicó esas condiciones y comparó dos maneras de inducir la compra, presionar al modelo o persuadirlo con evidencia. La presión suele volverse en su contra; la evidencia funciona mejor. En el escenario de escasez, Haiku 4.5 justificó no comprar señalando que la página usaba precisamente esas maniobras agresivas de venta, con escasez falsa y avisos de stock incluidas.

El modelo que se convence a sí mismo

Lo más incómodo son las trazas de razonamiento. Cuando el modelo genera una justificación larga en su propia voz, ese texto puede empujarlo a comprar aunque venga dentro de una llamada a herramienta. Es decir, el modelo acaba pesando su propia argumentación como si fuera un dato más de la decisión.

El contexto ayuda a entender el interés: OpenAI, Anthropic, Meta y otros están desplegando o anunciando agentes de compra, y Meta anda metida en un pulso con Amazon por Muse. Si los agentes ya están en producción y hay dinero de por medio en cada transacción, engañarlos deja de ser un ejercicio académico y pasa a ser un vector con incentivo económico detrás.

Conviene tomarlo con la cautela de un experimento personal. Los escenarios los montó una sola persona y no hay verificación independiente de los resultados. Aun así, la dirección apunta a algo que debería tener en cuenta cualquiera que despliegue un agente con acceso a una pasarela de pago: si un tercero controla el contenido que el agente lee, controla en parte su decisión de compra. La pregunta abierta es si esa resistencia crece con la capacidad del modelo o si se puede entrenar aparte, y con qué coste en falsos rechazos. El análisis completo, con gráficas, está en el blog del autor.