BookinglyTech News
Inteligencia artificial

Los jueces baratos ganan terreno a los LLM frontera en las tareas de decisión

TypeSafe cifra en 0,044 dólares cada 1.000 juicios de su modelo Jev, unas 277 veces más barato que GPT-6, y Xiaomi libera bajo MIT un modelo omni-modal de 1M de contexto.

3 min de lecturaLatent Space0 vistas

Una tanda de lanzamientos deja un patrón claro: los modelos pequeños entrenados para decidir —jueces, rerankers, clasificadores— hacen el trabajo de un LLM frontera por una fracción del coste, y quien los lleva a producción reserva los grandes para los casos dudosos. La familia Jev de TypeSafe es el caso mejor documentado, con decisiones tipadas y probabilidades en lugar de texto de razonamiento. En paralelo, Xiaomi ha publicado MiMo-V2.6-Pro bajo licencia MIT, omni-modal y con 1M de contexto.

Juzgar por menos de un dólar

El paper de Jev como juez cifra el coste en 0,044 dólares por cada 1.000 juicios y 152 ms de latencia mediana, unas 277 veces más barato que GPT-6. La precisión se queda a 3 puntos de GPT-6 en RewardBench y HaluEval, pero se descuelga 14,5 puntos en JudgeBench. La receta que está cuajando es una cascada: decide el modelo barato y solo los casos de baja confianza escalan a GPT-6 Astra. Así se conserva el 99% de la precisión con el 57% del coste.

El resto de la familia apunta igual. CLM, un modelo contrastivo que embebe la situación y las acciones candidatas y las ordena, va unas 9 veces más rápido que Jev y aguanta mejor como verificador de horizonte largo. GLiNER2.5-Decide, de Fastino, añade spans, relaciones y decisiones estructuradas consistentes con restricciones, a 167 ms en CPU y entre 38 y 47 ms en GPU. Tev1 0.8B es un clasificador del mismo tipo que corre en unos 50 ms extremo a extremo en local sobre Ollama. En el Decision Index v0.2, AutoJev-27B lidera los modelos abiertos a 0,8 puntos de Jev.

Los datos de producción acompañan: Ramp igualó la precisión de reranking de GPT-5.6 Luna con una latencia de cola diez veces menor (300 ms) y un tercio del coste, y el reranking nativo de turbopuffer ya incluye Jev. El propio Jev demostró 140 teoremas de Software Foundations por menos de un dólar, unas 130 veces más barato que Astra.

La ola de modelos frontera

MiMo-V2.6-Pro puntúa 46 en el índice de AA, justo por detrás de GPT-5.6 Sol (47), cuesta 0,13 dólares por tarea frente a 1,99 y Xiaomi ha liberado también el código de RL y los entornos de entrenamiento. El análisis que circula avisa de que sus mejoras por RL no generalizan a evaluaciones de matemáticas más duras.

Claude Opus 5.5 lidera SimpleBench con 88,4%. En Terminal-Bench-Science pasa del 24% con esfuerzo bajo al 62% con xhigh y cae al 59% con max; el consejo que se repite es evitar ese último nivel porque impone un presupuesto mínimo de razonamiento. Gemini 3.8 Flash se queda en 41 puntos del índice de AA, a 291 tokens por segundo y con 1M de contexto, gratis en Cline; en ARC-AGI marca 89,2% en la v2 a 0,40 dólares por tarea y 98,5% en la v1, pero solo 10,4% en la v3 con el arnés estándar. Grok 4.7 entró en el puesto 16 de Agent Arena a 1,14 dólares por tarea.

Databricks cuenta que sus ingenieros dejaron de tirar de modelos cerrados cuando los abiertos se enrutaron a sus agentes de código internos. Queda por comprobar si estos clasificadores aguantan cuando la tarea se alarga y el contexto se ensucia, que es justo donde JudgeBench ya les pasa factura.