BookinglyTech News
Inteligencia artificial

JevBench 1.3.0 clasifica 52 modelos de decisión con 534 tareas y un harness MIT

El benchmark propio de Benchmark Heaven puntúa inteligencia, calibración, velocidad y coste a partes iguales. El modelo más inteligente del cuadro no entra en el top 10.

3 min de lecturaShow HN0 vistas

Benchmark Heaven ha publicado JevBench 1.3.0, su banco de pruebas para modelos de decisión de la clase Jev: entra un estado y una rúbrica acotada, sale una respuesta tipada. Esta versión mide 52 sistemas sobre 534 decisiones, 220 de ellas duras, y los ordena con una nota que mezcla inteligencia, calibración, velocidad y coste, cada componente al 25 %.

No es un agregador. El harness, las tareas públicas y las reglas de puntuación son suyos y están bajo licencia MIT, con los resultados publicados como JSON y su sha256. Las 534 decisiones se reparten en 72 fáciles, 96 estándar, 146 de juicio y 220 duras, con el protocolo jevbench::v1.2, puntuadas el 21 de septiembre de 2026 y ejecutadas de una en una desde un servidor en Alemania.

La puntuación es una media geométrica de los cuatro componentes, con una penalización creciente (I/50)² para quien no llega a 50 de inteligencia. Eso deja a los clasificadores y rerankers al final del cuadro con inteligencia de un dígito, aunque sean baratos y rápidos: mxbai-rerank-base-v2, bge-reranker-v2-m3 y Certo v1 sacan como mucho un 7 en esa columna.

El coste pesa lo mismo que el acierto

El primer puesto es para Jev 1.13.0, con 74,4 puntos (inteligencia 86, calibración 83, velocidad 83, coste 52, 0,040 dólares). Le sigue SemIf sobre Qwen3.5-4B, 73,1 y 0,022 dólares estimados. En tercera posición aparece djev, pero con matices: lo medido fue la API alojada de Maisa en preview gratuita, con un precio anunciado de 0,035 dólares por millón de tokens de entrada y la salida gratis, y no se cobró nada. El runtime autoalojable, djev-dev, es Apache-2.0 y no añade pesos propios: aplica inferencia en un paso sobre el checkpoint diffusiongemma-26B-A4B-it de Google. Su documentación llama a las probabilidades experimentales y sin calibrar.

El dato que rompe la lectura habitual está en el puesto 14. GPT-5.6 Luna (low) saca la mejor inteligencia (95) y la mejor calibración (90) de la tabla, y aun así se queda en 65,9 porque su coste, 0,242 dólares, le pasa factura. En el otro extremo, kev 0.6B se cuela en el puesto 19 con 52 de inteligencia y 0,0063 dólares estimados. Además hay una mención de honor, classifier.dev, que no se clasifica porque ejecuta el modelo de otro participante, y varios partial runs listados aparte.

Benchmark Heaven marca con un asterisco los costes que no responden a ninguna factura: se estiman con los precios de un proveedor grande de inferencia. También avisa de que la latencia de los endpoints autoalojados y de demo se multiplica por dos, más 0,15 s, para aproximar carga de producción, y de que eso es una suposición y no una medición. La letra pequeña importa: sin ella, la columna de velocidad se lee como si todos los sistemas corrieran en las mismas condiciones.

La tabla sirve para lo que sirve un banco de pruebas abierto: comparar sobre las mismas 534 decisiones con las reglas a la vista en el repositorio. Queda por ver si otros lo adoptan como referencia o se queda en la herramienta de casa.