BookinglyTech News
Infraestructura

Guía de memoria para ejecutar modelos de IA local en Mac según la generación del chip

El rendimiento de los modelos de IA en Mac depende más de la memoria unificada que del procesador. Esta guía detalla qué tamaños de modelo caben en cada rango de RAM y cómo elegir según tu carga de trabajo.

2 min de lecturaDev.to0 vistas

El rendimiento de los modelos de IA local en Mac se mide por la memoria unificada disponible y, en menor medida, por la generación del chip. La memoria compartida entre CPU y GPU permite que el acelerador acceda a los pesos sin copiar datos a una VRAM separada, pero también provoca competencia con Safari, IDEs, Docker y el propio macOS.

Rango de memoria y modelos recomendados

Memoria Clase de modelo Uso típico Comentario
8 GB 2–4 B Q4 Chat corto, extracción Muy limitado, solo tareas ligeras
16 GB 7–9 B Q4/Q5 Escritura, documentos, código ligero Gpt‑oss‑20b cabe, pero sin espacio para contexto
24 GB 14–20 B, 27 B Q4 Asistente diario, RAG Rango práctico para la mayoría de usuarios
36–48 GB 27–35 B Q4 Codificación, agentes Espacio suficiente para IDE y navegador
64 GB 70 B Q4 Análisis complejo Requiere 42–48 GB para pesos
96–128 GB 70–120 B Trabajo con contexto largo y cargas paralelas Ideal para estaciones de trabajo

Los límites son aproximados: la memoria necesaria es la suma de pesos, caché de KV, buffers de cómputo, runtime, macOS y aplicaciones en segundo plano. Un modelo de 17 GB puede correr en 24 GB, pero se sentirá mejor en 36 GB.

Runtime recomendados

Runtime Ventajas Desventajas
Ollama Instalación sencilla, API local Menos control de afinación
MLX / MLX‑LM Conversión nativa para Apple Silicon Conversión puede tardar
llama.cpp Control total sobre caché y offload Requiere GGUF y compilación manual

Para la mayoría de los desarrolladores, comenzar con Ollama o LM Studio es suficiente. Si necesitas ajustes finos en el caché o en la gestión de memoria, llama.cpp es la opción.

Cargas de trabajo específicas

  • Codificación: un modelo de 9–20 B con un harness de código suele ser más útil que un modelo grande sin contexto adecuado.
  • Imágenes: generadores compactos funcionan con 16–24 GB; resoluciones altas y ControlNets aumentan el consumo.
  • Video: requiere 24–36 GB para clips cortos, pero no compite con un servicio en la nube.

Próximos pasos

Elige la generación de chip que mejor se adapte a tu flujo de trabajo, pero prioriza la memoria. La guía del AI Feed Local AI monitor permite comparar modelos por memoria, licencia y tarea. Si consideras ampliar la memoria, evalúa la rentabilidad frente a un chip más rápido.

Para más detalles técnicos sobre la memoria unificada en MLX, consulta el repositorio y para la compilación de llama.cpp mira la documentación oficial.