BookinglyTech News
Inteligencia artificial

WebLLM permite inferencia de LLM en el navegador con aceleración WebGPU

La nueva beta de WebLLM lleva los modelos de gran escala a los navegadores, ofreciendo compatibilidad total con la API de OpenAI y soporte para varios modelos populares.

2 min de lecturaConsole.dev0 vistas

WebLLM, el motor de inferencia de gran modelo (LLM) para navegadores, ha salido en versión beta. La herramienta ejecuta los modelos directamente en el cliente usando WebGPU, sin necesidad de servidores backend. Además, expone una capa compatible con la API de OpenAI, por lo que cualquier aplicación que ya consuma la API puede apuntar a WebLLM sin cambios de código.

Entre sus principales características están la generación de respuestas en tiempo real mediante streaming, soporte para el modo JSON estructurado y la posibilidad de controlar logits y semillas. La compatibilidad con la API incluye funcionalidades como "function calling" (en fase experimental) y respuestas en formato JSON, accesibles a través del WebLLM JSON Playground.

WebLLM soporta nativamente varios modelos de referencia: Llama 3, Phi 3, Gemma‑2B, Mistral‑7B y Qwen 2 en sus variantes de hasta 8 B parámetros. Los modelos se distribuyen en formato MLC, lo que permite compilar versiones personalizadas y cargarlas mediante la API de JavaScript. La lista completa de modelos compatibles se mantiene en la documentación oficial.

La integración es sencilla: el paquete está disponible en npm bajo el nombre @mlc-ai/web-llm y también puede cargarse vía CDN con jsDelivr. Un ejemplo básico muestra cómo crear una instancia de MLCEngine, registrar una callback de progreso y cargar un modelo seleccionado. La carga inicial puede ser pesada, ya que implica descargar los pesos del modelo, por lo que se recomienda habilitar el caché del navegador o usar un service worker para gestionar la persistencia.

WebLLM también ofrece soporte para Web Workers y Service Workers, lo que permite offload de los cálculos fuera del hilo principal y mejora la fluidez de la UI. Además, hay ejemplos de extensiones para Chrome que aprovechan el motor dentro de la barra de herramientas del navegador.

En resumen, la beta abre la puerta a aplicaciones de IA totalmente locales, con ventajas claras en privacidad y latencia. Queda por ver la madurez del soporte de modelos más grandes y la estabilidad del streaming, pero la propuesta ya permite a los equipos de desarrollo prototipar asistentes y herramientas de generación de código sin depender de infraestructura cloud.