BookinglyTech News
Software

Mia's AI Lab publica 16 recetas de LLM para GPU NVIDIA con rendimiento y configuraciones automatizadas

La comunidad de IA local recibe un nuevo repositorio con scripts que descargan, cuantizan y arrancan modelos LLM sobre DGX Sparks y GPUs RTX, incluyendo métricas de throughput y contextos máximos.

2 min de lecturaDev.to0 vistas

Mia's AI Lab, el proyecto open‑source de un solo desarrollador llamado Mia, ha lanzado 16 recetas para ejecutar LLMs localmente en hardware NVIDIA. Cada receta incluye un script que detecta la VRAM disponible, selecciona la cuantización adecuada y arranca un endpoint OpenAI‑compatible en un solo comando.

Las recetas cubren modelos como Qwen3.8‑27B‑Flash‑Next, GLM‑5.3‑Flash y DeepSeek V4 Flash, y están disponibles tanto para Windows como para Linux. El sitio publica métricas de rendimiento: token/s, peak throughput, prefill y contexto máximo, así como el número de GPUs o DGX Sparks requeridos. Por ejemplo, Qwen3.8‑Flash‑Next en un Spark 1x entrega 48.7 tok/s con 163 tok/s ×8 a 262 k context, mientras que GLM 5.3‑Flash en 2–4 Sparks alcanza 36.1 tok/s con 75 tok/s ×4.

Los usuarios de NVIDIA Developer Forums han confirmado que los números reflejados en la web son reproducibles. Un hilo sobre Qwen3.8‑Flash‑Next reporta que la velocidad es alta, aunque la calidad del modelo se ve afectada por la cuantización de 4‑bit. DeepSeek V4 Flash, por su parte, ha sido adoptado como modelo principal por otro usuario.

El proyecto también incluye sparkDash, un dashboard web que permite observar en tiempo real la utilización de recursos en un Spark o una GPU Linux. Además, Mia ha introducido un modo Install with an AI agent que permite que un agente de código (por ejemplo Claude Code) lea la receta, ajuste la configuración a la máquina local y arranque el servidor. El autor advierte que, debido a posibles errores de descarga o dependencias rotas, este modo debe usarse en entornos aislados.

En cuanto a la comunidad, las 16 recetas suman más de 5 000 estrellas en GitHub, lo que indica un interés considerable. Los repositorios están abiertos a contribuciones y cada uno contiene un README con instrucciones específicas y enlaces a los modelos en Hugging Face.

Para los arquitectos que evalúan la incorporación de IA local, estos recursos ofrecen una hoja de ruta concreta: basta con clonar el repositorio, ejecutar el script y, con la métrica de contexto y throughput incluida, decidir si la solución se ajusta a los requisitos de calidad y rendimiento.

La próxima fase será observar cómo la integración de agentes de código evoluciona y si las recetas logran equilibrar la velocidad con la calidad del output en escenarios de producción.