BookinglyTech News
Inteligencia artificial

Kev: modelos de decisión de 0,8B a 27B que imitan la API de Jev

El repositorio jaredpalmer/kev suma 6.644 estrellas en siete días con una familia de modelos de decisión sobre Qwen3.5 y Qwen3.8 que puedes entrenar y servir en tu propia máquina.

2 min de lecturaGitHub en alza0 vistas

El repositorio jaredpalmer/kev acumula 6.644 estrellas en siete días, unas 973 al día, y lo que hay dentro no es un juguete de fin de semana: es una familia de modelos de decisión pequeños, de 0,8B a 27B parámetros, construidos sobre Qwen3.5 y Qwen3.8 y pensados para entrenarse y ejecutarse en local. La arquitectura sigue la descrita en "Jev's Architecture Unmasked".

Kev contesta preguntas de sí/no, de opción múltiple y de puntuación en una misma petición. Las preguntas comparten el texto pero no pueden leerse entre sí. Cada checkpoint se publica con una temperatura ajustada sobre datos reservados, así que las probabilidades salen calibradas de fábrica. Y para quien ya tenga código escrito: la API es la misma que la de System One, el sistema de TypeSafe, de modo que su SDK de Python apunta a un servidor Kev sin cambiar una línea.

Cuatro tamaños y una tabla incómoda

Kev-0.8B arranca en cualquier Mac con Apple Silicon o una L4. Kev-4B y Kev-9B piden 32 GB en Mac, una L40S o una H100. Kev-27B, el más preciso, necesita una H100 de 80 GB, una H200 o una B200. Los tres primeros parten de modelos base de Qwen y comparten receta de entrenamiento; el 27B sale de una versión ya post-entrenada de Qwen cuyo dataset se desconoce.

En fuentes nuevas, es decir, datos y reglas que el modelo no vio durante el entrenamiento, Kev-27B firma 0,848 de desarrollo y 0,896 de test frente al 0,857 de Jev, el modelo alojado de TypeSafe. Kev-4B y Kev-9B se quedan a cuatro puntos. En Brier, que puntúa toda la distribución de probabilidad y donde menos es mejor, el 27B baja a 0,236 y 0,164, con Jev en 0,211. El propio README avisa de que no sabe con qué se entrenó Jev, así que la comparación entre arquitecturas no está controlada.

Puedes afinar los modelos con tus propios ejemplos etiquetados. Una skill de agente de código ejecuta el ciclo completo en Modal, desde localizar tus preguntas hasta servir el resultado, y el despliegue de un endpoint HTTPS propio se hace con un comando, con escalado a cero cuando nadie lo usa.

Cómo probarlo

Para mirarlo sin instalar nada está el Space de Hugging Face, que levanta Kev-4B y Kev-0.8B. En local hacen falta Python 3.12 o 3.13 y uv: el repositorio fija 3.13 en su .python-version porque torch todavía no tiene wheels para 3.14. Con GPU tira de CUDA o ROCm, y en Apple Silicon de MLX. La primera ejecución descarga el adaptador y el modelo base. Los pesos también están en la release de GitHub, con checksums SHA-256.

El interés no está en la comparación con Jev, que el propio autor acota, sino en el formato: un modelo de decisión pequeño, calibrado y autoalojado, que sustituye una llamada a una API ajena por un contenedor tuyo. Queda por ver si la receta se sostiene cuando los conjuntos de prueba dejen de ser los suyos.