BookinglyTech News
Inteligencia artificial

Enrutador con umbral de confianza: al LLM solo cuando compensa

Un desarrollador publica un sistema que usa Jev como clasificador para decidir si una petición la resuelve código determinista, el modelo o una persona.

2 min de lecturar/PromptEngineering0 vistas

Un desarrollador ha publicado el repositorio de un enrutador que decide cuándo merece la pena llamar al LLM y cuándo no. El mecanismo se apoya en Jev, que puntúa cada petición —qué ruta le toca, si la acción es irreversible, si es una tarea de programación, cuál es el radio de impacto— sin escribir nada. Con esas puntuaciones, el código elige entre ejecutar un manejador determinista, consultar al modelo, pedir confirmación al usuario o derivar a una persona.

El autor lo presenta como un sistema de enrutado con umbral de confianza, pensado para integrarse en proyectos propios y ajustable: los umbrales se pueden modificar. La idea de fondo es que una puntuación alta no autoriza nada por sí sola, solo selecciona una rama que el código ya sabe ejecutar. Todo lo dudoso o de alto riesgo cae al LLM o a un humano, y cada decisión queda registrada para recalibrar más tarde. El repositorio incluye además un enlace a documentación sobre patrones de enrutado por confianza.

Poco material para evaluarlo

El anuncio es escueto. No hay benchmarks, ni comparación de latencia o coste frente a llamar siempre al modelo, ni versión numerada, ni licencia indicada en el texto. Tampoco se aclara qué es exactamente Jev más allá de que actúa como clasificador: el autor no dice si es un modelo propio, uno ajustado o un prompt estructurado. Que no lo explique no significa que no exista, pero sin ese dato cualquiera que quiera reproducir el montaje se queda a medias.

El proyecto está en fase temprana, según su propio autor, y la publicación busca más bien gente que lo pruebe que usuarios en producción. La única pregunta que lanza es si otros han usado umbrales por acción en proyectos secundarios.

El interés está en el patrón. Buena parte de los despliegues con modelos generativos siguen mandando todo al LLM por defecto, y ahí se va dinero y latencia en peticiones que un condicional resuelve igual de bien. Poner una capa que puntúe antes de gastar tokens es una decisión de arquitectura razonable, sobre todo cuando hay acciones irreversibles de por medio. Lo que falta por ver es si el umbral aguanta en producción: calibrar mal esa frontera deja pasar lo que no debía o convierte el ahorro en llamadas duplicadas.