Simon Willison publica llm-typesafe, un plugin para el modelo Jev de TypeSafe AI
El complemento para la CLI LLM lanza preguntas de sí/no, de elección múltiple y de puntuación, y devuelve la respuesta ya en JSON estructurado.
Simon Willison ha publicado llm-typesafe, un plugin para LLM, su herramienta de línea de comandos, que añade soporte para Jev, el nuevo modelo de TypeSafe AI. Lo interesante no es que escriba texto: sirve para lanzar preguntas cerradas —sí o no, de elección entre varias opciones o de puntuación sobre una escala— y devuelve la respuesta ya en JSON estructurado.
Instalación y clave
Se instala como cualquier otro plugin del ecosistema:
llm install llm-typesafe
Después hay que registrar una clave de API, que se saca desde la consola de TypeSafe:
llm keys set typesafe
Willison apunta que la lista de espera para conseguir acceso "parece avanzar bastante rápido".
Tres formas de preguntar
El modo más simple es el booleano, al que el plugin llama "noul". Se le pasa el mensaje y la pregunta por separado:
llm -m jev 'Please refund my last payment.' \
-s 'Does this message explicitly request a refund?'
Y responde {"type": "noul", "noul": 0.99}.
Con -o answer_type choice se le entrega un conjunto de categorías con su descripción y el modelo elige una. El ejemplo que da es clasificar un mensaje de soporte entre facturación, técnico y otros, con la instrucción de que si aparecen a la vez un problema de cobro y uno técnico gane facturación.
Con -o answer_type score puntúa el texto contra una lista ordenada de criterios. El caso del README mide cuán reproducible es un informe de error en tres niveles: sin instrucciones de reproducción, instrucciones a las que les faltan pasos importantes, o pasos completos con el resultado esperado y el obtenido. Hay más detalle en el README del repositorio.
El movimiento de fondo es conocido: en vez de pelearse con el prompt para que un modelo general devuelva algo parseable, se tira de un modelo pensado para soltar directamente una etiqueta o un número. Para colas de triaje, clasificación de tickets o enrutado de mensajes eso quita bastante código de alrededor, que es donde suelen aparecer los errores.
Lo que no hay todavía son cifras independientes: ni latencia, ni precio por llamada, ni tasa de acierto de Jev. Todo lo que se sabe del modelo viene del propio autor del plugin.

