BookinglyTech News
Inteligencia artificial

Un investigador sostiene que su modelo de decisión open source llegó antes que Jev

En marzo de 2025 publicó un modelo no autorregresivo de decisión; ahora lanza RL Agent, con 421 millones de parámetros y 33-38 ms de latencia. Un laboratorio presentó la misma idea un año después.

3 min de lecturaLobsters0 vistas

El autor de un modelo de decisión no autorregresivo publicado en marzo de 2025 sostiene que un laboratorio de primera línea ha presentado la misma idea, un año después, como si fuera un descubrimiento nuevo. Acaba de lanzar RL Agent, una versión abierta y horizontal de aquel trabajo: 421 millones de parámetros y entre 33 y 38 milisegundos de latencia en GPU.

El relato viene con fechas y artefactos. El investigador, que firma como Nandakishor M., publicó en marzo de 2025 un paper, subió los pesos a Hugging Face, liberó el dataset de conversaciones, empaquetó la herramienta en PyPI y lo contó en r/LocalLLaMA. En septiembre de 2025 llegó un segundo paper con el marco de decisiones basadas en esquema guiadas por aprendizaje por refuerzo. Aquel primer modelo usaba PPO sobre representaciones de secuencia para producir trayectorias de conversión turno a turno, con probabilidades entre 0 y 1, en conversaciones de ventas verticales.

En septiembre de 2026, según su versión, TypeSafe AI lanzó Jev. El autor presenta a su fundador, Diogo Almeida, como coinventor de ChatGPT en OpenAI. Jev propone el mismo concepto no autorregresivo, generalizado con RLCD (Reinforcement Learning for Calibrated Decisions) para devolver distribuciones de confianza y elecciones de esquema, a 0,042 dólares por millón de tokens de entrada y con respuestas típicas de unos 150 ms. La diferencia que le escuece: sin papers, sin pesos abiertos y sin datasets de entrenamiento. La cifra de precio y latencia es la que dio el propio laboratorio en su lanzamiento.

De vertical a horizontal, y con encoder

RL Agent no es un LLM generativo. Es un encoder ModernBERT-large bidireccional de 395 millones de parámetros (28 capas, dimensión oculta de 1024, 16 cabezas, MLP GeGLU) con una cabeza de decisión encima, hasta sumar 421 millones. Recibe un estado —texto, correo, ticket o JSON— y una o más preguntas tipadas, y las evalúa todas en un único forward pass paralelo.

Las primitivas son tres: choice, que elige una opción de un diccionario y devuelve etiquetas con sus probabilidades; score, que sitúa el estado en una rúbrica ordinal tipo 0, 1, 2, 3 y devuelve un valor esperado; y noul, una pregunta booleana que devuelve la probabilidad calibrada de que sea verdadera. Sirve para enrutar departamentos, detectar phishing, medir si un prompt intenta romper el sistema o clasificar urgencia.

El argumento técnico es que el espacio de salida son solo números y probabilidades. No genera texto, así que no alucina ni puede devolver JSON roto, y la calibración deja de ser una frase que suena convincente en la respuesta de un modelo generativo. El código está en GitHub y el paquete se instala desde PyPI.

La comparación de latencias la firma el autor, no un tercero, y no hay banco de pruebas independiente que la respalde. Tampoco se puede verificar desde fuera que el concepto de Jev sea el mismo que el suyo: eso es su lectura. Lo que sí es comprobable es la ruta de acceso al modelo, sus pesos y sus papeles.

Si la promesa aguanta, el interés es de operación pura. Cambiar la llamada a un LLM generativo por un clasificador calibrado de 421 millones en un solo forward pass mueve a la vez la factura de inferencia y la latencia de cualquier pipeline de enrutado, filtrado de spam o moderación, que es donde ahora se está quemando dinero sin necesidad.