BookinglyTech News
Software

Ollama y LM Studio: la licencia y el despliegue deciden, no la velocidad

Los dos son gratuitos y envuelven llama.cpp, pero Ollama es MIT y API-first mientras LM Studio es una app de escritorio propietaria, gratis para uso interno desde julio de 2025.

3 min de lecturaDev.to0 vistas

Ollama y LM Studio hacen lo mismo por debajo —los dos son envoltorios de llama.cpp con rutas Apple MLX— y la decisión no va de rendimiento, sino de flujo de trabajo y licencia. Ollama es MIT de punta a punta, se instala como servicio y expone un endpoint HTTP local; LM Studio es una aplicación de escritorio propietaria de Element Labs, gratis para casa y para uso interno en la empresa desde julio de 2025, con catálogo de modelos y ventana de chat.

Licencia y despliegue sin cabeza

Ollama no tiene navegador de modelos ni chat en el producto base, y eso es justo lo que le permite encajar en editores, frameworks de agentes y trabajos de CI: un ollama pull qwen3.8 y a hablar con él desde código. El repositorio va por 181.000 estrellas y 17.800 forks. La 0.34.0, del 9 de septiembre de 2026, añadió la posibilidad de usar modelos de Ollama dentro de ChatGPT Desktop en macOS y mejoró la salida estructurada en Apple Silicon, además de búsqueda de herramientas y compactación de respuestas compatibles con OpenAI.

LM Studio ha cerrado su hueco headless. La 0.4.0 trajo el demonio llmster para cajas Linux y equipos con GPU, más batching continuo con cuatro slots en paralelo por defecto. La 0.4.22 hizo que las imágenes devueltas por herramientas funcionaran tanto en los endpoints compatibles con OpenAI como en el /v1/messages compatible con Anthropic, un detalle que importa si tu tooling se construyó contra la forma de la API de Claude. Y la 0.4.24 sumó overrides de argumentos de llama.cpp, overrides de plantillas de prompt y decodificación especulativa en carga con soporte de visión activado por defecto.

La diferencia de licencia se nota en el trabajo. Ollama es auditable de arriba abajo. LM Studio cubre el uso interno con sus términos, pero la aplicación sigue siendo código cerrado: si tu política exige código revisable, ahí se acaba la conversación.

Lo que cuesta cada uno

LM Studio no tiene nada que vender. Ollama es gratis en local y lo que cobra es inferencia alojada: plan Free con créditos de arranque y una petición concurrente, Pro a 20 dólares al mes (200 al año) con 60 dólares de crédito mensual y tres peticiones, y Team a 500 dólares al mes con 1.000 dólares en créditos compartidos y diez peticiones. El precio por token varía mucho según el modelo: gpt-oss:20b sale a 0,07 de entrada y 0,30 de salida por millón de tokens fuera de hora punta, mientras kimi-k3 se va a 3,00 y 15,00. La hora punta es de 12:00 a 18:00 UTC entre semana y algunos modelos casi doblan: deepseek-v4.1-flash pasa de 0,15/0,60 a 0,30/1,20. Todo está en la página de precios.

El hardware manda más que la herramienta. qwen3.8:27b es un GGUF de 18 GB con contexto de 256K, así que un portátil de 16 GB necesita otro modelo o una cuantización más agresiva. Y en las pruebas que acompañan a la comparación, el modelo elegido movió el resultado mucho más que cualquier ajuste del runtime. Para quien monta agentes locales, eso conviene tenerlo claro antes de pelear por el envoltorio.