TypeSafe AI lanza Jev, un modelo orientado a decisiones de software con RLCD
Jev propone una alternativa a los LLMs de chat, usando Reinforcement Learning for Calibrated Decisions para mejorar la fiabilidad en tareas de Sistema Uno.

TypeSafe AI ha presentado Jev, su nuevo modelo de System One pensado para integrarse en flujos de software en vez de servir como asistente conversacional. Diogo Almeida, CEO de la compañía, explicó que los modelos autoregresivos afinados para chat han degenerado en problemas de alineación, rechazo y fiabilidad. Jev, según el video de lanzamiento que ya supera los 40 millones de visualizaciones, busca revertir esa tendencia.
La innovación central de Jev es el Reinforcement Learning for Calibrated Decisions (RLCD), una técnica inédita que optimiza respuestas con probabilidades epistemicamente honestas en tareas de Sistema Uno, en lugar de depender del feedback humano tradicional (RLHF) o de rúbricas programáticas (RLVR). Almeida argumenta que RLHF produce alucinaciones y dependencia humana, mientras que RLVR resuelve problemas como Navier‑Stokes pero genera inteligencias fragmentadas y difíciles de integrar.
En la charla de AIE NYC, Almeida describió cómo los últimos años de investigación en OpenAI (InstructGPT, Function Calling, Structured Outputs) fueron vistos como “parches” sobre el paradigma de predicción secuencial. Tras varios intentos fallidos entre 2023‑2024 para entrenar un modelo fiable, el equipo de TypeSafe se centró en la calibración del modelo como objetivo principal. El enfoque se detalla en su ensayo sobre la Tyranny of the KV Cache y en la documentación oficial de la compañía.
Jev ya incluye varios patrones y cookbooks para casos de uso como juegos, control por voz y navegador, agentes de codificación, análisis de datos y resolución de entidades “dark data”. Uno de los objetivos declarados es desaparecer en el fondo del software, similar a lo que hace una expresión regular: ser útil sin ser visible. La arquitectura permite crear agentes de programación, agentes de linting y herramientas de compresión de llamadas a funciones, todo bajo una única capa de modelo.
Para los equipos de desarrollo, la propuesta implica replantear la arquitectura de IA: en lugar de encadenar prompts extensos, se sugiere descomponer los flujos en decisiones pequeñas y medibles, usando estado estructurado para reemplazar mensajes de sistema gigantes. Esto favorece la observabilidad y el control de errores, algo crítico en entornos de producción.
El anuncio también toca la visión de TypeSafe sobre el futuro de los laboratorios de IA: priorizar inteligencia por dólar y operar como un data lab más que como un model lab. Almeida critica los benchmarks públicos, argumentando que no reflejan la utilidad real en aplicaciones de software. En cambio, propone métricas de fiabilidad y robustez como norte.
Queda por ver cómo se traducirá la promesa de RLCD en métricas concretas y si la comunidad adoptará el enfoque de System One frente al dominio de los modelos de chat. El debate sobre la calibración frente al alineamiento humano sigue abierto, y Jev será probablemente el primer caso de estudio serio en esa línea.
Documento sobre la Tyranny of the KV Cache ofrece una visión profunda de los retos que Jev pretende superar. Para entender mejor las críticas a RLHF, la documentación oficial de TypeSafe resume los problemas que el nuevo modelo busca evitar.


