Privatemode convierte un LLM estándar en un modelo de decisiones tipo Jev
Un artículo técnico demuestra cómo usar GLM-5.3-Flash en vLLM para obtener decisiones tipadas con probabilidades en un solo pase, igualando a Jev.

Privatemode ha publicado un artículo técnico donde demuestra que es posible convertir un modelo de lenguaje estándar en un sistema de decisiones binarias o múltiples, comparable a los modelos especializados como Jev de TypeSafe o Laya. La clave no está en el fine-tuning, sino en el diseño del prompt y en la manipulación de las salidas del modelo (logits) para extraer probabilidades directas sobre un conjunto finito de opciones.
El problema que atacan es el de la latencia y el coste en escenarios de alto volumen. Cuando pides a un LLM que tome una decisión (por ejemplo, clasificar un ticket o validar una cláusula), normalmente debe generar un objeto JSON completo. Esto implica decenas o cientos de tokens de razonamiento y formato por cada consulta. Privatemode propone saltarse esa generación: el prompt se construye para que la única cosa que el modelo tiene que "predecir" sea el índice de la opción correcta.
La técnica consiste en tres pasos. Primero, se enumeran las opciones en el prompt y se precarga la respuesta del asistente con el prefijo conocido. Segundo, se fuerza al modelo a emitir solo el índice correspondiente. Tercero, en lugar de leer el token generado, se leen las probabilidades asignadas por el modelo a cada uno de esos índices en esa única posición de la secuencia. Al normalizar esas probabilidades, se obtiene una distribución de confianza para cada opción, permitiendo elegir la más probable y conocer su certeza. Esto se hace en un solo forward pass, eliminando la sobrecarga de la generación secuencial.
Para la implementación, usan GLM-5.3-Flash corriendo sobre vLLM. Mencionan detalles específicos de la librería: el uso de allowed_token_ids para restringir el vocabulario de salida y, crucialmente, logprob_token_ids en lugar de top_logprobs. Este último dato es importante para quien quiera replicarlo: top_logprobs devuelve la distribución antes de las restricciones, lo que puede incluir tokens de formato no deseados y hacer que aparezcan opciones válidas con probabilidad cero. logprob_token_ids, por el contrario, devuelve la probabilidad exacta de los IDs que solicites, independientemente de si están en el top-K general.
El artículo incluye un benchmark con datos públicos que, según sus autores, iguala la precisión y velocidad de Jev. Además, destacan una ventaja incremental: al usar el endpoint /chat/completions de vLLM, pueden pasar imágenes junto al texto, algo que permite decisiones tipadas sobre contenido visual, algo que los modelos dedicados como Jev no soportan directamente en su arquitectura actual.
Para los equipos que trabajan con inferencia de alto volumen donde la precisión de formato y la latencia son críticas, esto es una alternativa viable a mantener modelos pequeños especializados. No requiere entrenar nada nuevo, solo ingeniería de prompt específica y acceso a los logits crudos del proveedor de inferencia. El código está disponible para quien quiera probarlo en su propia infraestructura.
Implementación en vLLM
El repositorio privatemode-decisions contiene la lógica para extraer estas probabilidades. El detalle técnico sobre cómo vLLM maneja las restricciones de token y cómo obtener los logprobs correctos es lo más aprovechable del artículo para un administrador de sistemas o ingeniero de ML. Si estás evaluando si sustituir un modelo de clasificación especializado por un LLM generalista, esta técnica sugiere que la brecha de rendimiento puede ser menor de lo que se cree, siempre que controles el pipeline de inferencia con precisión.

