BookinglyTech News
Inteligencia artificial

Jeff: modelos de decisión de 0,8B y 2B entrenados en casa que responden en 30 ms

Fine-tunes de Qwen3.5 y Gemma 4 para clasificación zero-shot: devuelven una probabilidad calibrada por opción en un solo forward pass, con el mismo formato de petición que Jev.

3 min de lecturaHacker News (top)0 vistas

Jeff es un conjunto de fine-tunes de Qwen3.5 y Gemma 4 con una única misión: clasificación zero-shot. Le describes una situación, le listas las opciones en lenguaje natural y devuelve una probabilidad calibrada para cada una en un solo forward pass. Nada de texto generado ni de parseo posterior. La latencia ronda los 22 ms por decisión en una RTX PRO 6000 y los 28 ms en un Apple M4 Max vía MLX.

Qué hace y qué no

La gracia del zero-shot es que las categorías no tienen que aparecer en los datos de entrenamiento. Valen colas de soporte, intenciones de usuario, etiquetas de moderación, comandos de voz o movimientos de juego. El formato de petición es el mismo que usa Jev, pero el proyecto no está afiliado a TypeSafe, la empresa que lo desarrolla, ni cuenta con su respaldo. El autor parte de la receta open source AutoJev.

Hay tres tipos de pregunta: choice (elegir una de hasta 255 opciones), noul (sí/no devuelto como probabilidad) y score (un punto en una escala que describes). Varias preguntas independientes se contestan juntas en una misma llamada, y cada respuesta incluye la probabilidad por opción, la opción elegida y un nivel de confianza.

El propio autor marca los límites sin adornos. Son modelos muy pequeños: hacen juicios rápidos y bien calibrados entre opciones, pero su razonamiento no puede compararse con el de Jev, que corre sobre un modelo mucho mayor.

Benchmarks

Sobre 4.599 preguntas de cinco benchmarks públicos, la variante de 2B saca un 83,1 global frente al 83,0 que publica Jev; la de 0,8B se queda en 79,1. En clasificación y grounding los números aguantan bien: 96,4 en Financial PhraseBank, 88,9 en RAGTruth con Gemma 4 E2B. Donde no llega es en razonamiento: 64,0 en BBH frente a los 94,3 de Jev, y 47,6 en el tier difícil de JevBench frente a 73,3. Las cifras de Jev y AutoJev se midieron sobre una muestra distinta de los mismos benchmarks, así que la comparación directa es orientativa.

Todo el pipeline se hizo en hardware local. El 0,8B entrena en unas dos horas en una sola RTX PRO 6000 y el 2B en tres y media. Los datos sintéticos los escribió un modelo abierto, Qwen3.8-Flash-Next, sobre dos DGX Sparks, y las pruebas se corrieron en un MacBook. No hay GPUs en la nube ni salidas de modelos cerrados en el conjunto de entrenamiento; un modelo cerrado se usó solo para comprobar por muestreo la calidad de los datos sintéticos.

Para probar el zero-shot en algo que no se parece a los benchmarks, el autor puso a Jeff a jugar. En Doom iguala al bot de reglas escrito a mano con 6,55 bajas por episodio; en Frogger lo supera por poco (10,3 cruces frente a 10,25) y en Pac-Man se queda en 57 de 98 bolas frente a las 94,1 del bot. Durante las partidas, el modelo decide en 29-49 ms por movimiento en un M4 Max, mientras que la ejecución publicada de Jev en Doom tardaba 212 ms por llamada a través de su API. Los tiempos no se midieron sobre el mismo hardware.

Los pesos están en Hugging Face, con Jeff-Qwen3.5-0.8B y Jeff-Qwen3.5-2B, más una variante sobre Gemma 4. Si la precisión zero-shot no llega para lo que tienes entre manos, un ajuste corto con ejemplos propios cambia el panorama: el fine-tune de navegación por voz del autor pasó del 31,7% al 95,8% de acierto en datos no vistos en menos de media hora y con una sola GPU. Ese es el dato que conviene retener antes de descartar los modelos pequeños para clasificar en local.