Laya, un motor de decisiones no autorregresivo, llega a 3.544 estrellas en GitHub
El repositorio de NandhaKishorM, en Python y con licencia Apache 2.0, enruta tres checkpoints para devolver decisiones tipadas en un solo pase, sin generar texto.
Laya ha pasado de cero a 3.544 estrellas en GitHub en tres días, a un ritmo medio de 1.344 al día, y su autor lo presenta como un motor de decisiones, no como un modelo de lenguaje. Está en Python, bajo licencia Apache 2.0, y el repositorio todavía no tiene ni descripción.
La diferencia con un LLM es que Laya no genera nada. Responde preguntas tipadas —choice, score y noul— sobre un estado cualquiera (un texto, un correo, un ticket, un JSON) en un solo forward pass. En una T4 mide 33 ms por pregunta, y 7,2 ms por pregunta si van en lote. Al no haber texto generado no hay salida que parsear ni alucinación que limpiar, y cada respuesta llega con su nivel de confianza por campo.
Tres checkpoints y un enrutador
El repo publica tres pesos y un Router que elige uno por petición: laya, sobre ModernBERT-large, con 421 millones de parámetros y 512 tokens de contexto, para inglés; laya-multilingual, sobre mmBERT-base, con 322 millones y 1.024 de contexto, para más de 100 idiomas y el doble de rápido; y laya-typed-decisions, también ModernBERT-large, orientado a los flujos de decisión tipada. El enrutador detecta alfabeto e idioma en menos de un milisegundo y despacha al checkpoint óptimo, devolviendo metadatos de por qué eligió ese.
Los números los firma el autor
Las cifras salen de un banco de 17.416 preguntas sobre una sola T4, con el mismo conjunto para cada modelo: en intención de MASSIVE, el checkpoint inglés saca 0,783 y el multilingüe 0,657; en los otros trece idiomas, 0,306 frente a 0,451. En XNLI, 0,860 y 0,843 en inglés, y 0,521 frente a 0,731 en los otros catorce. El multilingüe deja 45 de 51 idiomas usables (más de 3x el azar) frente a 23 del inglés. La latencia, 39,5 ms frente a 32,8 ms con una pregunta, y 158,6 frente a 72,3 con diez en lote.
Lo más útil del README es el fallo que documenta: el modelo inglés se hunde en alfabetos no latinos, con khmer en 0,000 de precisión y 0,952 de confianza. Si el modelo se equivoca con esa seguridad, filtrar por umbral de confianza no arregla nada; hay que enrutar antes de inferir. Para quien monta clasificadores, la propuesta es concreta: automatizar por encima de 0,85 de confianza y escalar a un humano por debajo, sin tocar la salida del modelo.
Todo el benchmarking lo publica el autor, no un tercero, y el repositorio tiene tres días de vida. Conviene leer el código y reproducir los números antes de meterlo en producción.


