TypeSafe AI lanza Jev, un modelo que devuelve decisiones en vez de texto
El primer modelo System One de la compañía acepta texto y devuelve números con probabilidades y puntuaciones de confianza. Cuesta 0,042 dólares por millón de tokens de entrada y la salida es gratis.
TypeSafe AI presentó la semana pasada Jev, el primer representante de lo que la compañía denomina modelos System One y que buena parte de la comunidad prefiere llamar modelos de decisión. La clave está en la salida: Jev acepta texto, pero no devuelve texto. Devuelve números en coma flotante asociados a categorías, preguntas de sí o no, valoraciones y la confianza que asigna a cada una.
La compañía lo describe como "una llamada a función de inteligencia de frontera: entra estado no estructurado, salen decisiones probabilísticas tipadas". El modelo es rápido y barato. Solo se paga la entrada: 0,042 dólares por millón de tokens, por debajo de los 0,05 dólares del GPT-5 Nano de OpenAI. La salida es gratuita.
Tres tipos de pregunta
Se le envía un objeto de estado (una cadena, un array de cadenas o pares nombre-valor que describen un artículo, un cliente o cualquier otro registro) junto a una o varias preguntas. Hay tres modalidades:
- Preguntas Noul, el nombre que TypeSafe da a las de sí o no (su CEO confirmó en Hacker News que viene de Bernoulli). Se plantea una afirmación y se recibe un número entre 0 y 1 con la confianza de que sea cierta.
- Preguntas de elección, donde el modelo escoge entre varias opciones y devuelve la distribución de probabilidad sobre todas ellas.
- Preguntas de puntuación, con una escala numérica con descripciones y un valor dentro de ese rango.
Las preguntas se evalúan en paralelo, así que mandar muchas cuesta un tiempo similar a mandar una sola.
La documentación de la versión 1.13 sobre "jaggedness" deja claro dónde flojea: números, fechas y contenido adversarial. Brilla en todo lo que sea clasificación (detección de spam, sugerencia de etiquetas, priorización, ranking) y en reordenar resultados de búsqueda: se recuperan 100 candidatos con un algoritmo barato como BM25 y Jev los puntúa por relevancia frente a la consulta original.
Caja negra
Jev es un paso más hacia el aprendizaje automático de caja negra. Un LLM al menos puede intentar justificar una decisión, aunque nada garantice que la justificación sirva. Aquí no hay ni eso: entra texto y sale un número. Si marca algo como spam, qué señal lo provocó queda oculto. La preocupación por el sesgo es central, y el propio modelo ya da pistas: un experimento pidiendo valorar si varias ciudades del área de la bahía de San Francisco son "buena ciudad" colocó a Cupertino arriba y a East Palo Alto abajo.
De ahí que las evaluaciones y los experimentos estructurados importen más que en un proyecto normal con LLM. Como es tan barato, lanzar cientos o miles de pruebas cuesta unos céntimos.
Ya hay ecosistema
En menos de una semana han aparecido proyectos alrededor. jevchat convierte a Jev en un chatbot malísimo: en cada paso pregunta qué símbolo viene después. jev-leftpad reimplementa left-pad preguntando cuántos espacios hacen falta para llegar a la longitud objetivo. Hay incluso quien lo usa para jugar al 2048. En el lado de los pesos abiertos, Kev replica el comportamiento sobre Qwen 3.5 en versiones de 0,8B, 4B y 9B, y ya circula un benchmark, JevBench, para comparar este tipo de modelos.
Para probarlo desde la terminal, el plugin llm-typesafe añade soporte a la herramienta LLM.
Queda por ver si el enfoque cuaja más allá de la clasificación. De momento, que en pocos días hayan salido un chatbot, un benchmark y varias recreaciones con pesos abiertos da una idea del hueco que ocupaba una API así.

