BookinglyTech News
Inteligencia artificial

Kev: modelo de decisiones sin generación de texto que ahorra tokens

Jared Palmer lanza Kev, una familia de modelos basados en Qwen 3.5 que decide sin generar texto, reduciendo el consumo de tokens y el coste de ejecución.

3 min de lecturaThe New Stack0 vistas

Kev es un modelo de decisiones que evita la generación de texto y, con ello, el gasto de tokens asociado a los agentes de IA. En lugar de enviar cada pregunta a un generador autoregresivo, el modelo procesa el estado, la pregunta y los candidatos en una única pasada y devuelve un puntero con las probabilidades.

El nuevo lanzamiento incluye modelos de 0,8 bn, 4 bn y 9 bn de parámetros construidos sobre Qwen 3.5. El enfoque pre‑fill‑only permite leer las decisiones con un head de puntero, sin bucle de decodificación. Los tipos de decisión son:

  • Noul – respuesta sí/no
  • Choice – selección entre candidatos
  • Score – nivel ordenado de puntuación

Un ejemplo de salida para una decisión de enrutamiento es:

search: 0.82
database: 0.13
calculator: 0.05

Kev puede decidir incorrectamente, pero al limitarse a los candidatos proporcionados evita introducir opciones no previstas. Los pasos de enrutamiento, verificación de seguridad, escalada y ranking pueden delegarse a la capa de decisión, dejando los modelos de razonamiento abierto para la generación de texto.

El rendimiento también mejora. El modelo 4B procesa tres preguntas en 277 ms en BF16 sobre una GPU M5. Aunque no se dispone de una comparación directa con Qwen generando respuestas equivalentes, la reducción de pasos sugiere un ahorro de tiempo y energía.

En cuanto a precisión, el modelo 9B alcanzó 83,7 % en una prueba fuera de dominio bloqueada (ver model card). No obstante, los autores advierten que la calibración de probabilidades puede desviarse con distribuciones no vistas, lo que afecta a decisiones basadas en umbrales. El fine‑tuning también reduce el rendimiento en pruebas de conocimiento general y aritmética, especialmente en los modelos más pequeños.

Kev es completamente abierto: pesos, código de entrenamiento y herramientas de evaluación están disponibles bajo Apache 2.0, lo que permite a los desarrolladores ejecutar y afinar el modelo en su propia infraestructura. En contraste, la variante Jev de TypeSafe no publica pesos ni datos de entrenamiento.

La propuesta de Kev encaja en el patrón de strip‑down que se ve en arquitecturas de agente: se elimina la generación cuando la tarea es simplemente una elección o una probabilidad. Así, el modelo de decisión se ejecuta sobre la misma infraestructura que el modelo generador, reduciendo la latencia y el coste de tokens.

El impacto de este enfoque será mayor a medida que los bucles de agente crezcan en complejidad. Con decisiones que se realizan repetidamente –enrutamiento, clasificación, escalada– Kev puede manejar varias en una sola pasada, lo que facilita la depuración y la optimización del flujo de trabajo.

Para quienes ya usan generadores como Qwen o GPT‑4, integrar Kev podría ser tan simple como cambiar la API de decisiones por la de TypeSafe, manteniendo la compatibilidad con aplicaciones existentes.

En definitiva, Kev ofrece una alternativa práctica y open source para reducir el coste de tokens en agentes de IA sin sacrificar la capacidad de decisión, aunque los desarrolladores deben prestar atención a la calibración y al ajuste de modelo para evitar errores de decisión.

Para más información sobre el modelo 9B, consulta la model card.