BookinglyTech News
Inteligencia artificial

Qwen-Image 2.1 cabe en un Mac de 48 GB, pero su licencia no deja venderlo

Se ejecuta en local con ComfyUI en un Mac de 48 GB, con medianas de 143,5 s por imagen a 1024×1024. Los pesos salen bajo licencia de investigación: nada de uso comercial.

3 min de lecturaDev.to0 vistas

Qwen publicó Qwen-Image 2.1 el 20 de septiembre de 2026: un modelo unificado para generar y editar imagen, con salida transparente nativa, hasta diez imágenes de referencia y mejoras en texto y fidelidad visual. El generador son 7.000 millones de parámetros repartidos en 32 capas de diffusion-transformer de flujo único. Y hay un detalle que condiciona cualquier plan que se haga con él: los pesos descargables van bajo la Qwen Research License Agreement, cuya sección 2 limita la concesión a fines no comerciales y exige una licencia aparte para producción. El propio acuerdo define uso no comercial como investigación o evaluación.

Eso no es un permiso general para meter los pesos en entregables de cliente. Un servicio alojado puede tener otras condiciones, pero son suyas y hay que revisarlas por separado. Descarga local, ejecución en la máquina y permiso comercial son tres decisiones distintas, y conviene resolver la tercera antes de pasar días montando un pipeline de assets.

El 7B no es todo el presupuesto de memoria

Un flujo local de imagen no es solo el modelo de difusión. Hay un codificador de texto que prepara el condicionamiento, un VAE que convierte entre píxeles y la representación interna, y las imágenes de referencia con sus datos intermedios ocupando sitio. El paquete de Comfy trae archivos separados para el modelo de imagen, el text encoder Qwen3-VL 8B y el VAE, en variantes BF16 y cuantizadas.

La configuración que se probó usa qwen_image_2.1_int8_convrot.safetensors, qwen3vl_8b_int8_convrot.safetensors y qwen_image_2.1_vae_bf16.safetensors. Los nombres importan: un tiempo medido con esta combinación no vale para un pipeline sin cuantizar. Como cálculo rápido de almacenamiento, 7.000 millones de valores a dos bytes son 14 GB antes de contar el resto de componentes y las asignaciones en tiempo de ejecución. Es aritmética, no una medición de memoria: que el archivo pese menos no dice cuánta RAM pide la inferencia ni a qué velocidad corre el backend.

Las cifras sobre la mesa

La máquina del análisis es un MacBook Pro M5 Pro con 18 núcleos de CPU, 20 de GPU y 48 GB de memoria unificada, con macOS 27.0, ComfyUI 0.37.0 y PyTorch 2.12.1 sobre MPS. En Apple la CPU, la GPU, el sistema y el resto de aplicaciones comparten el mismo presupuesto físico, y las cifras de CUDA no se trasladan a MPS sin más.

Se completaron 20 generaciones locales: cuatro imágenes base, cuatro assets transparentes, cuatro ediciones, tres pósteres, cuatro en alta resolución y una referencia sintética. La configuración medida fue 25 pasos, sampler Euler, scheduler simple, CFG 1, batch uno, prompt negativo vacío, sin LoRA, sin upscaler y sin retoque manual. Las medianas en caliente: 143,5 segundos a 1024 × 1024 y 343,5 segundos a 1536 × 1536. La plantilla oficial de Comfy usa esos ajustes; el ejemplo de referencia de Qwen usa 40 pasos, así que los números de uno y otro no se mezclan.

El resultado más útil del experimento es incómodo: las imágenes convencían aunque fallaran en cosas concretas, como colocar un elemento donde tocaba, reproducir un texto exacto o dejar un color intacto. Para evaluar de verdad hace falta generar, pedir una revisión específica, colocar el asset en una maqueta real y contar cada intento. La tarjeta del modelo documenta capacidades; lo que un flujo guardado demuestra y lo que se mide en tu máquina son cosas distintas. Y la licencia, en este caso, va primero.