Laya, un modelo de decisión open source que clasifica riesgo sin un LLM
El proyecto se apoya en ModernBERT, se ejecuta en local y devuelve puntuaciones en lugar de texto. Su autor lo ha probado con riesgo de fraude en pedidos y ha medido latencias.

Laya es un modelo de decisión open source construido sobre ModernBERT. No es un LLM generativo: no escribe texto, sino que recibe datos estructurados y devuelve puntuaciones, etiquetas o nulos, y está pensado para correr en local. Su autor lo ha probado durante un fin de semana con un detector de riesgo de pedidos de comercio electrónico y ha publicado el experimento junto al repositorio y a una demo.
El argumento de partida es conocido: no hace falta un modelo enorme para tareas de decisión simples, como validar un formulario, clasificar un ticket de soporte o puntuar el riesgo de un pedido. Ahí pesan más la latencia y la consistencia que la capacidad de redactar. El autor presenta a Laya como un modelo de decisión no autorregresivo, lo que llama un sistema "System One": respuesta directa, sin cadena de generación por medio.
Las reglas de negocio no salen del modelo
Lo primero que probó fue pedirle un veredicto directo: aprobar, revisar o retener. El modelo tendía a retener todos los pedidos, incluso los que parecían normales. La conclusión del experimento es que ese reparto es una decisión de negocio, distinta en cada empresa: una que venda artículos caros será más conservadora que una pequeña que prefiera aprobar y seguir. La solución fue separar las dos capas. El modelo estima el riesgo y la aplicación decide con umbrales propios: por ejemplo, por debajo de 30 aprobar, entre 30 y 70 revisar y por encima de 70 retener.
El formato de la entrada importa
El segundo hallazgo tiene que ver con cómo se presenta cada campo. Con un dato crudo como failed_payment_attempts: 0, el modelo se fijaba en la palabra "failed" y lo leía como señal de riesgo, un sesgo semántico que también aparece en los LLM. Reescribirlo como una frase natural ("el cliente tiene un historial de pagos limpio, con 0 intentos fallidos") o cambiar el campo a all_payment_attempts: successful mejoró bastante el resultado.
CPU, GPU y VPS
Las cifras de rendimiento son del autor, no de un tercero. En un portátil modesto cada petición se iba por encima de los 5 segundos; en una T4 de Colab bajaba de un segundo. Después movió el backend a un VPS propio de 2 vCPU y 4 GB de RAM, donde promedia unos 4 segundos por petición.
Lo interesante no es Laya en concreto, sino la línea que dibuja: modelos pequeños y especializados para tareas concretas, en lugar de un LLM generalista para todo. Lo que falta por ver es un benchmark reproducible y comparaciones con alternativas. De momento hay un experimento, un repositorio y números medidos en una sola máquina.
