Inteligencia artificial··3 min de lectura

Slotstream ejecuta un modelo de 104 GB en un Mac de 48 GB

Una herramienta de código abierto permite correr Qwen3.8-Flash-Next en Macs con poca memoria, transmitiendo los pesos desde el SSD. Rinde unos 12 tokens por segundo en un M5 Pro.

Un desarrollador ha publicado Slotstream, una utilidad que ejecuta el modelo de lenguaje Qwen3.8-Flash-Next en Macs que no tienen memoria suficiente para cargarlo entero. El modelo, un Mixture-of-Experts de 125B parámetros, ocupa 104 GB en disco en cuantización de 4 bits, pero Slotstream lo transmite desde el SSD y lo ejecuta en la memoria disponible, sin necesidad de Python: es un único binario Swift que habla los protocolos de Ollama y OpenAI, así que las herramientas existentes funcionan sin cambios.

En un Mac M5 Pro con 48 GB, el autor reporta una velocidad de decodificación de unos 12 tokens por segundo, con una latencia de 3 segundos hasta el primer token y un pico de memoria de 32 GB. La herramienta incluye un modo 'doctor' que simula el rendimiento según la RAM de tu equipo, aunque solo la cifra del M5 Pro está medida en hardware real; las demás son estimaciones. También avisa de que necesitas unos 110 GB de disco libre y que, en la práctica, un Mac de 512 GB es el mínimo recomendable.

Cómo funciona

La clave está en que casi todo el peso del modelo reside en dos partes: 68 GB de expertos enrutados (512 por capa, de los cuales se activan 10 por token) y una tabla n-grama de 32 GB. Solo el tronco denso (3.8 GB) permanece en memoria. Los expertos se leen con 'pread' en un pool fijo de caché compartido entre todas las capas, de modo que las capas calientes toman prestados slots de las frías. El tamaño de la caché afecta a la velocidad, pero no a la salida: la decodificación es byte-idéntica con 4 GB o con 24 GB de caché, algo que verifican con pruebas automáticas.

El autor explica por qué no usa mmap directamente: MLX (el framework de Apple) no puede materializar parte de un tensor mapeado, así que un gather de los 10 mejores expertos evaluaría los 512 de esa capa, cargando unos 100 GB y acabando en swap. De hecho, la ruta estándar de mlx_lm.load() llevó a este Mac de 48 GB a un swap de 48 GB sin producir un solo token.

Instalación y uso

La instalación es una línea: curl -fsSL ... | sh. El binario se puede verificar con GitHub Attestation o compilarlo uno mismo con las Command Line Tools. La descarga de los pesos, 103.8 GB repartidos en 24 archivos, tarda unos 35 minutos en una conexión típica; se puede interrumpir y reanudar, y los archivos se comprueban con SHA-256. El autor avisa de que Hugging Face limita la transferencia a unos 36-57 MB/s, así que a partir de 400 Mbps el cuello de botella es de ellos, no tuyo.

Una vez instalado, slotstream serve levanta un servidor en el puerto 11434 compatible con Ollama y OpenAI. Soporta streaming, CORS y opciones de muestreo habituales, pero no herramientas, imágenes ni salida JSON-schema, y devuelve un error claro si lo pides. El contexto máximo es de 32.768 tokens.

Limitaciones honestas

El autor es transparente sobre lo que no está probado: solo se ha medido en el M5 Pro de 48 GB; los tiers de menos memoria son estimaciones. La herramienta ejecuta únicamente este modelo concreto (qwen3.8-flash-next:4bit), aunque el diseño está pensado para su geometría. Los prompts largos tardan en procesarse: 8.000 tokens pueden esperar un minuto en un Mac de 48 GB. Y la decodificación especulativa, que acelera usando un head auxiliar, solo se activa con mucha memoria libre; en cachés pequeñas no compensa.

Queda por ver si Slotstream se convierte en una alternativa real a las soluciones de pago para ejecutar modelos grandes en hardware modesto. Por ahora, es una demostración técnica impresionante, con el código y las mediciones disponibles para que cualquiera lo reproduzca.

##Relacionado