BookinglyTech News
Inteligencia artificial

MicroLLM Lab ejecuta siete modelos pequeños de lenguaje en el navegador

El banco de pruebas corre siete LLM pequeños, el menor de 135 millones de parámetros, y mide velocidad y precisión sin sacar los datos de la máquina.

2 min de lecturaHacker News (top)0 vistas

MicroLLM Lab es un banco de pruebas que se ejecuta entero en el navegador y deja lanzar siete modelos de lenguaje pequeños, el menor de ellos de 135 millones de parámetros, para medir cuánto tardan y cuánto aciertan. Los resultados no salen de la máquina. El proyecto ha aparecido en la portada de Hacker News y su planteamiento es el de un laboratorio de bolsillo más que el de un producto.

Qué mide

Dos cosas. Por un lado, velocidad: tokens por segundo, decodificación sostenida y el tiempo total que tarda la suite de pruebas en pasar. Por otro, precisión: la tasa de aprobación en comprobaciones objetivas. Ahí no hay criterio humano ni jurado; las pruebas consisten en expresiones regulares y tokens exactos aplicados sobre el texto que decodifica el modelo. Un modelo de 135 millones de parámetros puede fallar esas comprobaciones, y la propia página lo asume como parte de la medición: lo que se busca es un número reproducible, no una impresión.

El flujo es manual. Se eligen los modelos, se lanzan y se espera. La estimación de tiempo se apoya en el último dato de tokens por segundo que la herramienta tenga registrado para ese modelo. Cada modelo mantiene su propia suite más reciente, y las gráficas se construyen con esa última ejecución, no con un promedio histórico.

Los benchmarks se escriben en JavaScript. El editor se evalúa con eval() en el propio origen de la página, y cada comprobación corre después sobre el texto decodificado. Ese detalle importa a quien vaya a escribir sus propias pruebas: está ejecutando código en el contexto de la página, con todo lo que eso implica si algún día se pega ahí algo que no es tuyo.

Lo que importa

Correr modelos pequeños en local ya no es una curiosidad de fin de semana, y medirlos con números duros —tokens por segundo reales, no los de una ficha técnica— es lo que necesita quien tiene que decidir si un modelo de bolsillo sirve para clasificar, resumir o extraer campos en su propia infraestructura. Que la medición ocurra dentro del navegador y no salga del equipo encaja con esa idea, sobre todo para perfiles que no quieren subir datos a un servicio ajeno solo para saber qué latencia tienen.

Queda por ver qué siete modelos son exactamente y con qué runtime se ejecutan en el navegador, porque el material publicado no entra en ese detalle.