BookinglyTech News
Inteligencia artificial

Kev, modelos de decisión de 0,8B a 9B sobre Qwen3.5 para ejecutar en local

El proyecto de Jared Palmer publica pesos, código de entrenamiento y datos de evaluación de tres modelos que responden preguntas cerradas con probabilidades, no con una etiqueta.

3 min de lecturaHacker News (top)0 vistas

Jared Palmer ha publicado Kev, una familia de modelos de decisión pequeños construidos sobre Qwen3.5 y pensados para entrenarse y ejecutarse en local. Hay tres tamaños —0,8B, 4B y 9B— con pesos preentrenados, código de entrenamiento y datos de evaluación. No compiten con un LLM generalista: resuelven preguntas cerradas de tipo sí/no (noul), elección múltiple (choice) y puntuación (score), devuelven probabilidades en vez de una etiqueta seca y admiten varias preguntas dentro de la misma petición.

Cómo se sirve y qué preguntas responde

La API copia la de System One, así que su SDK de Python apunta a un servidor local sin tocar nada. El arranque pide Python 3.12 o superior y uv: se levanta Kev-4B con KEV_DTYPE=bf16 python -m kev.serve --run jaredpalmer/kev-4b --port 8009, y la primera ejecución descarga el adaptador y el modelo base. El parámetro --run también acepta un directorio local o una revisión del Hub.

Las preguntas viajan en un mismo cuerpo JSON, comparten el texto de entrada pero no pueden leer las respuestas de las otras. Eso es lo que permite pedir departamento, escalado y nivel de frustración de una misma reclamación y que cada respuesta se calcule por su cuenta. El endpoint devuelve probabilidades por opción, un campo de confianza y, en las de tipo score, una leyenda con los valores. En el ejemplo del repositorio, Kev-4B en bf16 sobre un Apple M5 tarda 495 ms con 101 tokens de entrada y 161 de salida.

El soporte de ejecución cubre CUDA, ROCm y Apple Silicon. Los modelos de 4B y 9B en bf16 entran en un Mac con 32 GB de memoria unificada; el de 0,8B es la opción mínima. También hay un entorno web de pruebas en local, con Node 20.9 o superior, y plantillas para comparar todas las preguntas empaquetadas contra preguntas separadas, permutar el orden de las opciones y comprobar el aislamiento entre preguntas.

Los números

Sobre fuentes vistas durante el entrenamiento, Kev-9B saca 0,872/0,874 de exactitud y 0,286/0,237 de Brier en desarrollo/prueba; Kev-4B, 0,872/0,871 y 0,299/0,255; Kev-0,8B baja a 0,825/0,834 y 0,499/0,460. En fuentes nuevas, que es donde se mide la transferencia, Kev-9B marca 0,822 en desarrollo y 0,852 en prueba, frente al 0,857 en desarrollo de Jev Hosted. La comparación con este último no es controlada: sus datos de entrenamiento no son públicos.

Los tres modelos se actualizaron el 21 de septiembre de 2026 con una segunda pasada corta sobre ejemplos generados, con casos de políticas que llevan recuentos de días explícitos y casos a los que se les quitó la evidencia decisiva. En prueba eso movió a Kev-9B de 0,837 a 0,852 y a Kev-0,8B de 0,668 a 0,684. Los pesos anteriores siguen accesibles en la revisión v7-b.

Lo interesante aquí no es el tamaño ni la exactitud, sino el formato de salida: probabilidades por opción y varias decisiones independientes en una sola llamada. Para clasificar tickets, enrutar correo o etiquetar datos sin montar un pipeline aparte, el cuello de botella suele ser la latencia y el coste por token, y un modelo de 0,8B a 4B en hardware propio cambia esa cuenta. Lo que falta por ver es si la transferencia a dominios ajenos al entrenamiento aguanta cuando las preguntas no se parecen a las del conjunto de evaluación.