BookinglyTech News
Inteligencia artificial

jevals permite evaluar agentes LLM con decisiones tipadas en lugar de juzgadores de texto

El nuevo paquete jevals envía todas las métricas de una traza en una sola petición, reduciendo costos y latencia frente a los jueces tradicionales basados en LLM.

2 min de lecturaShow HN0 vistas

OpenLayer AI ha publicado jevals, una librería Python que sustituye los jueces de texto de los agentes LLM por modelos de decisión tipo Jev. En lugar de lanzar varios calls a un modelo generativo, jevals agrupa ocho métricas —como selección de herramienta, pertinencia de respuesta y detección de inyección indirecta— en una única solicitud HTTP. El coste reportado es de 0,00006 USD por petición (unos pocos miles de centésimas de centavo) y el tiempo medio de respuesta ronda los 330 ms.

El flujo típico es: se construye un diccionario con los mensajes del agente y los esquemas de herramientas, se llama a evaluate() y se obtienen objetos con atributos como tool_choice.answer (p = 0,99) o grounded.score (0,5). La API acepta el formato de mensajes de OpenAI, bloques de contenido de Anthropic o directamente objetos de LangChain, lo que facilita su integración.

El principal obstáculo que jevals intenta resolver es el costo de los jueces LLM. Herramientas como Ragas usan de dos a tres llamadas por métrica, generando varios segundos de latencia y consumiendo cientos de dólares al mes en producción. Los modelos de Jev, por el contrario, no generan texto; reciben un estado y un conjunto de preguntas tipadas (sí/no, opción múltiple, rúbrica) y devuelven probabilidades calibradas en un solo forward pass. La paralelización de preguntas hace que preguntar a 40 ítems cueste prácticamente lo mismo que preguntar a uno.

Los precios de Jev son de 0,042 USD por millón de tokens de entrada, sin cargos por salida. Vercel AI Gateway reporta p50 = 244 ms y p95 = 371 ms por solicitud. En la semana posterior al lanzamiento aparecen modelos de peso abierto compatibles con la misma API, como Kev (basado en Qwen‑3, ejecutado localmente en macOS) y Laya (ModernBERT, ~10 ms en Apple Silicon).

Desde el punto de vista de arquitectura, jevals se integra como una capa de guardrails que puede usarse en tres contextos: como métrica offline, como monitor en trazas de producción y como puerta de seguridad dentro del bucle de ejecución del agente. La clase base Eval define tres métodos (state, questions, reduce) que permiten describir, preguntar y consolidar resultados de forma genérica. Cuando se pasan varios evals a evaluate(), sus estados se combinan y sus preguntas se empaquetan en una sola petición.

La librería también ofrece versiones síncronas y asíncronas (aevaluate) y funciones de chequeo (check, acheck) para usarla como gate dentro de pipelines de agentes. Los backends se resuelven según variables de entorno, con soporte para TypeSafe, Vercel y OpenRouter.

Importancia: jevals abre la puerta a una evaluación continua y de bajo coste de agentes LLM, algo que hasta ahora se hacía de forma esporádica por el alto gasto de los jueces tradicionales. Con una latencia comparable a la de una llamada a un modelo y precios prácticamente insignificantes, los equipos pueden monitorear cada traza en producción y ajustar sus prompts o lógica de herramientas sin comprometer la velocidad del servicio.