Los avisos de fraude iban al equipo de pagos hasta describir cada opción en el prompt
Un clasificador de mensajes bancarios enrutaba los fraudes a pagos porque las etiquetas del prompt eran solo nombres de equipo. Añadir una línea por categoría lo corrigió.
Un desarrollador que enruta reclamaciones bancarias hacia distintos equipos se encontró con que los avisos de fraude acababan en el departamento de pagos. Las opciones de su clasificador eran solo nombres de equipo, sin nada más, y tanto un chatbot como un segundo modelo, al que llama Jev, elegían "payments" una y otra vez. La solución fue añadir una línea por equipo describiendo qué asunto lleva cada uno, y lo cuenta en un vídeo. Con eso, los dos modelos pasaron a mandar el caso a seguridad.
El mensaje de entrada era corto y ambiguo:
there is a payment that is not mine
Un cargo que el usuario no reconoce es un fraude, pero la palabra "payment" es la única pista léxica del texto. Si las etiquetas disponibles son "payments", "cards" o "security" sin explicación, el empate se resuelve por parecido superficial. Describir el alcance de cada etiqueta, qué tipo de casos atiende cada equipo, cambia la representación que el modelo tiene de las opciones, no la del mensaje. Por eso el arreglo es barato: una frase por clase.
Los números
El autor los da sobre unas 3.000 conversaciones de Banking77, un conjunto público de mensajes bancarios con 77 intenciones. Cuando Jev marcaba un caso como seguro, acertaba en 98 de cada 100. Es su propia medición, no la de un tercero, y no detalla cómo se calculó ni cómo se contaban los casos dudosos.
Tampoco identifica con precisión el segundo modelo ni publica la comparativa antes y después del cambio en el prompt. Lo único disponible es el vídeo donde lo explica: no hay repositorio, ni nota técnica, ni los prompts completos.
Lo aprovechable es la idea, que ya se ve en sistemas de enrutado y en agentes con herramientas. Cuando las categorías se eligen por nombre, el modelo rellena el hueco con lo que se le ocurre, y suele rellenarlo mal. Poner la descripción de cada opción dentro del prompt sale más barato que entrenar un clasificador. Cuánto aguanta eso cuando las categorías son decenas o cientos es la pregunta que aquí queda sin responder.