Guía de memoria para ejecutar modelos de IA local en Mac según la generación del chip
El rendimiento de los modelos de IA en Mac depende más de la memoria unificada que del procesador. Esta guía detalla qué tamaños de modelo caben en cada rango de RAM y cómo elegir según tu carga de trabajo.

El rendimiento de los modelos de IA local en Mac se mide por la memoria unificada disponible y, en menor medida, por la generación del chip. La memoria compartida entre CPU y GPU permite que el acelerador acceda a los pesos sin copiar datos a una VRAM separada, pero también provoca competencia con Safari, IDEs, Docker y el propio macOS.
Rango de memoria y modelos recomendados
| Memoria | Clase de modelo | Uso típico | Comentario |
|---|---|---|---|
| 8 GB | 2–4 B Q4 | Chat corto, extracción | Muy limitado, solo tareas ligeras |
| 16 GB | 7–9 B Q4/Q5 | Escritura, documentos, código ligero | Gpt‑oss‑20b cabe, pero sin espacio para contexto |
| 24 GB | 14–20 B, 27 B Q4 | Asistente diario, RAG | Rango práctico para la mayoría de usuarios |
| 36–48 GB | 27–35 B Q4 | Codificación, agentes | Espacio suficiente para IDE y navegador |
| 64 GB | 70 B Q4 | Análisis complejo | Requiere 42–48 GB para pesos |
| 96–128 GB | 70–120 B | Trabajo con contexto largo y cargas paralelas | Ideal para estaciones de trabajo |
Los límites son aproximados: la memoria necesaria es la suma de pesos, caché de KV, buffers de cómputo, runtime, macOS y aplicaciones en segundo plano. Un modelo de 17 GB puede correr en 24 GB, pero se sentirá mejor en 36 GB.
Runtime recomendados
| Runtime | Ventajas | Desventajas |
|---|---|---|
| Ollama | Instalación sencilla, API local | Menos control de afinación |
| MLX / MLX‑LM | Conversión nativa para Apple Silicon | Conversión puede tardar |
| llama.cpp | Control total sobre caché y offload | Requiere GGUF y compilación manual |
Para la mayoría de los desarrolladores, comenzar con Ollama o LM Studio es suficiente. Si necesitas ajustes finos en el caché o en la gestión de memoria, llama.cpp es la opción.
Cargas de trabajo específicas
- Codificación: un modelo de 9–20 B con un harness de código suele ser más útil que un modelo grande sin contexto adecuado.
- Imágenes: generadores compactos funcionan con 16–24 GB; resoluciones altas y ControlNets aumentan el consumo.
- Video: requiere 24–36 GB para clips cortos, pero no compite con un servicio en la nube.
Próximos pasos
Elige la generación de chip que mejor se adapte a tu flujo de trabajo, pero prioriza la memoria. La guía del AI Feed Local AI monitor permite comparar modelos por memoria, licencia y tarea. Si consideras ampliar la memoria, evalúa la rentabilidad frente a un chip más rápido.
Para más detalles técnicos sobre la memoria unificada en MLX, consulta el repositorio y para la compilación de llama.cpp mira la documentación oficial.

