BookinglyTech News
Inteligencia artificial

Jevstiller destila Jev en local para responder en 15 ms sin gastar tokens

El proyecto open source aprende de las consultas que ya pasan por Jev y resuelve las habituales en la CPU del equipo, con auditorías para no desviarse del modelo original

3 min de lecturaThe Register2 vistas

Jevstiller es un proyecto open source que se coloca delante de Jev y aprende de las peticiones que ya pasan por él para resolver las habituales en el propio hardware. Sus creadores dicen que una respuesta local puede salir de la CPU del equipo en unos 15 ms, frente a los 300 ms de media que tarda Jev, y sin gastar un solo token de los que cuesta el servicio remoto. El objetivo declarado es mantener un 98 % de acuerdo con Jev.

Conviene recordar qué es Jev: un paradigma de diseño de IA que renuncia a la generación de texto libre y se limita a responder tres tipos de pregunta, Choice, Score y Noul. Al no tener que rumiar el lenguaje humano, sale rápido y barato, a 42 dólares por cada mil millones de tokens de entrada, y se está ganando el interés de quien necesita decisiones estructuradas donde un LLM generativo completo sobra.

Una caché que sabe cuándo no sabe

El equipo describe Jevstiller como una caché delante de Jev. El arranque es sencillo y algo contraintuitivo: el modelo local no sabe nada, así que al principio todo se reenvía a Jev con la clave del propio usuario, se devuelve su respuesta sin tocar y cada par de pregunta y respuesta queda registrado como fila de entrenamiento. Cuando hay suficientes muestras por clase, un worker en segundo plano ajusta un modelo estudiante y una política de enrutado. Las entradas familiares se contestan en local; el resto sigue yendo a Jev.

El problema de diseño que persiguen es mantener el acuerdo con el modelo remoto, y la solución que proponen es auditar sin parar. Un 2 % fijo de todas las peticiones va a Jev pase lo que pase, con la respuesta local guardada al lado para comparar. Según explican en la documentación del proyecto, es la única forma de obtener una visión insesgada del enrutado, porque el sistema rechaza por diseño las preguntas difíciles. Si la auditoría detecta que el acuerdo cae por debajo del objetivo configurado, sube la tasa de auditoría y el reentrenamiento se acelera. Y si el sistema cree que su capacidad de coincidir se ha hundido, todo vuelve a Jev y el entrenamiento arranca de cero desde ese punto.

Acuerdo no es exactitud

La prueba que enseñan es un soak de 24 horas en el que un Jev de sustitución cambió en silencio todas sus respuestas a las doce horas. La cuota local pasó del 90 % al 9 % en cuatro minutos, cuando las auditorías lo detectaron, y volvió al 90 % en 49 minutos, entrenando solo con respuestas posteriores al cambio y sin que nadie tocara nada. También admiten la letra pequeña: que el modelo local coincida con Jev no significa que acierte. "Acuerdo no es exactitud", reconocen en su nota sobre las garantías, porque Jev sigue siendo otro modelo de IA que se equivoca.

Para quien administre sistemas, la propuesta es una capa de inferencia local, con la latencia y el coste que eso ahorra, pero también con un segundo modelo que hay que entrenar, auditar y versionar. La tasa de acuerdo es configurable, así que el 98 % es una meta de partida y no una promesa: cada equipo tendrá que decidir cuánto está dispuesto a desviarse de Jev para dejar de depender de él en cada consulta.