BookinglyTech News
Inteligencia artificial

Laya clasifica con un encoder de 322M en vez de esperar a un LLM generativo

El proyecto expone seis endpoints de decisión sobre un encoder bidireccional que, según su autor, resuelve el pase del modelo en menos de 35 ms en RAM.

2 min de lecturaDev.to0 vistas

Un desarrollador ha publicado Laya, una pasarela de decisión que resuelve tareas de clasificación —triaje de tickets, detección de inyección de prompts, filtrado de spam— con un encoder bidireccional de 322 millones de parámetros en vez de con un LLM generativo. El autor mide el pase del modelo por debajo de los 35 ms en RAM, frente a los 1.500-3.500 ms que se van esperando a que un modelo autoregresivo termine de escribir. El código está en el repositorio y el acceso se distribuye a través de RapidAPI con una capa gratuita.

La idea de fondo no es nueva, pero se olvida con frecuencia: para decidir entre tres etiquetas no hace falta generar texto. Un modelo generativo produce token a token, y en una tarea estructurada eso se traduce en latencia que nadie aprovecha, derivas de formato —se le pide un enum y devuelve una frase de relleno— y un coste por token que se acumula en cuanto la cola crece. Laya va por el otro camino: un encoder mmBERT de 322 millones de parámetros, no autoregresivo, que mapea la entrada a un espacio vectorial y calcula probabilidades categóricas calibradas en un único pase hacia delante.

Seis endpoints acotados

El servicio expone seis rutas. /v1/triage clasifica la consulta por departamento (facturación, técnico, cuenta), le asigna nivel de urgencia y marca riesgo de baja; /v1/guard hace de cortafuegos contra jailbreaks y sobrescritura del system prompt; /v1/filter/spam separa consultas reales de correo comercial; y /v1/sentiment, /v1/moderate y /v1/decide cubren tono y frustración, moderación multietiqueta y decisiones booleanas sobre un payload arbitrario.

Conviene leer los números de latencia con la tabla delante. El autor separa tres capas: menos de 35 ms el modelo, entre 40 y 70 ms el microservicio en el borde con TLS 1.3, y entre 750 y 1.200 ms si la llamada pasa por el proxy público de RapidAPI, que añade validación de clave y contabilidad de cuota. Dicho de otro modo, la cifra del titular solo se sostiene si se llama directo. Que publique el desglose en lugar de un único número le hace favor.

En privacidad promete no registrar ni almacenar el texto del cliente: los payloads viven en memoria solo durante la inferencia y se descartan al responder. La capa gratuita son 16.666 peticiones al día, unas 500.000 al mes.

Todo esto son mediciones suyas. No hay benchmark de un tercero ni comparación contra los modelos que critica con el mismo conjunto de datos, y el proyecto es de una sola persona. La arquitectura tiene sentido para clasificación estrecha y es la dirección correcta cuando el presupuesto de latencia es de decenas de milisegundos. La duda razonable es si un encoder afinado aguanta la variedad de un tráfico real sin reentrenar, y eso no lo responde ninguna tabla.