Hugging Face lanza 207 kernels WebGPU para acelerar la IA en el navegador
El equipo WebAI de Hugging Face publica una biblioteca de kernels optimizados para WebGPU, con benchmarks que muestran mejoras de hasta 10.000x en casos concretos.
Hugging Face ha publicado una colección de 207 kernels WebGPU listos para usar, junto con una biblioteca JavaScript para cargarlos y ejecutarlos en el navegador. El objetivo es acelerar la inferencia de modelos de IA localmente, sin depender de servidores. La compañía asegura que, en sus pruebas, estos kernels son de media 2,57 veces más rápidos que ONNX Runtime Web, la alternativa más extendida.
Los kernels son operaciones de bajo nivel (sumas, multiplicaciones de matrices, normalizaciones, etc.) que se ejecutan en la GPU. Hasta ahora, cada runtime los implementaba a su manera, y el rendimiento variaba mucho según el dispositivo y el navegador. Hugging Face los publica como paquetes versionados e independientes en el Hub, con su contrato, pruebas de corrección y benchmarks incluidos. Así, cualquier desarrollador puede inspeccionarlos, reproducir los resultados o usarlos como referencia para sus propias implementaciones.
Cómo funciona
La biblioteca, llamada @huggingface/kernels, se instala desde npm y permite cargar un kernel con una sola llamada: getKernel('webgpu-kernels/ai.onnx.Add', { version: 1 }). Luego se invoca con los datos de entrada y la forma de los tensores, y el kernel se encarga de calcular la forma de salida y asignar la memoria. El ejemplo más simple es sumar dos tensores con broadcasting, pero la misma API sirve para operaciones pesadas como la multiplicación de matrices.
Cada kernel incluye variantes para diferentes formas de entrada y tipos de dispositivo. Por ejemplo, la suma tiene una variante para tensores del mismo tamaño, otra para broadcasting vectorizado y una para casos generales. El runtime elige la variante adecuada según la llamada y el hardware, sin que el desarrollador tenga que preocuparse.
Resultados y límites
Los benchmarks se hicieron en un Apple M4, comparando 809 casos donde ambos sistemas coincidían en la salida. En la mayoría (629 casos) los kernels de Hugging Face fueron más rápidos. En operaciones comunes como Add, Softmax o LayerNormalization, las mejoras van de 1.14x a 3.52x. Pero hay casos extremos: un Einsum bilineal con tamaño 4096 fue 10.000 veces más rápido (0.136 ms frente a 1.396 ms), y un CumSum por filas fue 301 veces más rápido. La compañía advierte que son casos inusuales y que las cifras miden solo el tiempo de GPU, sin contar la carga de kernels o la compilación de shaders. Además, los resultados pueden variar según el navegador y la GPU.
Para afinar esa variabilidad, Hugging Face lanza también Fleet, una herramienta que ejecuta los kernels en el navegador del usuario y recopila, con su consentimiento, métricas de rendimiento y corrección. Así esperan detectar fallos en dispositivos que no pueden probar en laboratorio y mejorar las variantes.
Por qué importa
Este es el primer paso de una estrategia más amplia para hacer que la IA en el navegador sea más rápida y fiable. Al publicar kernels como artefactos versionados y reproducibles, Hugging Face establece una base sobre la que construir runtimes de más alto nivel. La compañía ya trabaja con el equipo de ONNX Runtime para integrar estas mejoras en el ecosistema general. Queda por ver si la comunidad adopta estos kernels y si las ganancias de rendimiento se mantienen en una variedad más amplia de dispositivos y modelos completos.
##Relacionado

Unity 6.6 ya está aquí: WebGPU listo para producción y preparativos para Unity 7
Unity 6.6 llega como versión soportada con WebGPU estable para Web, análisis de compilaciones y cambios de cara a Unity 7.
DLSS 5 promete fps enormes, pero la renderizacion neural preocupa
Nvidia publica sus primeros benchmarks oficiales de DLSS 5 con subidas de fps espectaculares, aunque el rendimiento base de la renderizacion neural es mucho mas modesto.

La jerga de los 'agentes IA' enciende el debate sobre cómo narrar el ciberataque a Hugging Face
Un blog de Dwarkesh Patel sobre el hackeo a Hugging Face ha reavivado la disputa sobre si usar términos humanos para describir acciones de la IA.