Laya, un modelo de decisiones abierto que promete ser 6 veces más rápido que Jev
El autor publica tres checkpoints Apache 2.0 basados en encoders bidireccionales que devuelven probabilidades calibradas sin generar texto

Laya es una familia de modelos de decisión de código abierto que acaba de publicarse con pesos Apache 2.0, SDK en PyPI y código en el repositorio. La propuesta es concreta: en vez de llamar a un LLM generativo para decidir a qué departamento va un ticket o si un correo entrante es phishing, se usa un encoder bidireccional que resuelve la pregunta en una sola pasada hacia delante y no escribe ni un token.
El autor no esconde el cabreo en el anuncio. Cuenta que él construyó algo parecido en marzo de 2025: paper en arXiv, pesos y dataset en Hugging Face, paquete en PyPI y una discusión en Reddit. Después, en septiembre de 2026, una startup llamada TypeSafe AI —fundada, según su texto, por un co-inventor de ChatGPT— lanzó Jev con el mismo concepto y sin papers, sin pesos abiertos y sin datasets públicos. La comparación que hace es suya y no hay benchmark independiente que la respalde: Jev cobra 0,042 dólares por millón de tokens de entrada con respuestas típicas de unos 150 ms, mientras que Laya mide 32,8 ms en una sola GPU y 7,2 ms por pregunta en lote, entre 6 y 8 veces menos latencia según sus cifras.
Tres primitivas, cero texto generado
El modelo evalúa preguntas tipadas sobre un estado cualquiera —texto crudo, un correo, un ticket, un documento JSON— y devuelve siempre lo mismo: números. Hay tres primitivas. choice elige una opción de un diccionario y devuelve la clave, la distribución completa y una confianza calibrada. score sitúa el estado en una rúbrica ordinal de niveles 0, 1, 2. Y noul responde una pregunta booleana con P(true) entre 0 y 1, con P(false) = 1 - P(true) por construcción.
El argumento de fondo es que el espacio de salida son probabilidades, no tokens, así que no hay alucinación posible ni JSON malformado. La confianza que da un LLM generativo es otra predicción de tokens, no una medida calibrada; aquí es la salida del modelo.
Tres checkpoints y descarga por subcarpetas
Los pesos vienen en tres variantes. laya usa ModernBERT-large, 421M de parámetros y 512 de contexto, para clasificación en inglés, guardarraíles y triaje de correo. laya-multilingual se apoya en mmBERT-base con vocabulario de 256k, 322M de parámetros y contexto de 1024 ampliable a 8k, cubre más de 100 idiomas y va 2,2 veces más rápido. laya-typed-decisions, también ModernBERT-large de 421M y contexto de 1024, apunta a observabilidad de agentes, atención al cliente, facturas y alertas de seguridad, con 0,766 de precisión.
El SDK evita descargar los 2,5 GB del paquete completo: usa allow_patterns de Hugging Face para bajarse solo la subcarpeta pedida, unos 808 MB el inglés y 647 MB el multilingüe.
El dato que más debería leer quien tenga pipelines en producción es el barrido sobre MASSIVE en 51 idiomas con 20 opciones y línea base aleatoria de 0,050. Un modelo inglés con vocabulario BPE de 50.000 tokens destroza alfabetos no latinos: en jemer da 0,000 de precisión con una confianza media declarada de 0,952. Ninguna decisión correcta en cien preguntas, y casi un 95% de seguridad. En armenio se queda en 0,050.
Ahí está el hueco real para este tipo de modelos: enrutado, triaje y guardarraíles donde la alternativa es pagar una llamada a un LLM para extraer una etiqueta con expresiones regulares. Que los pesos sean abiertos permite autohospedarlos y medirlos con tus propios datos, que es la única forma de comprobar si los 32,8 ms y las probabilidades calibradas se sostienen fuera del anuncio.

