Alibaba publica Qwen Image 2.1, un modelo de imagen de 7.000 millones de parámetros
El modelo de pesos abiertos cabe en una RTX 3090 y, según sus autores, supera a Nano Banana 2.0 de Google, aunque la comparación procede de un benchmark interno.

Alibaba Cloud ha publicado Qwen Image 2.1, un modelo de generación de imágenes de pesos abiertos que se queda en 7.000 millones de parámetros. Sus desarrolladores aseguran que rinde por encima de varios modelos de pesos cerrados, entre ellos Nano Banana 2.0 de Google.
El tamaño es lo que llama la atención. Para generación de imágenes, 7.000 millones de parámetros son una cifra baja, y eso tiene una consecuencia práctica: el modelo entra en tarjetas gráficas de consumo de generaciones anteriores, como una RTX 3090. Quien tenga una estación de trabajo con ese tipo de GPU puede ejecutarlo en local sin depender de una API externa ni de facturación por token. Al tratarse de pesos abiertos, además, se puede inspeccionar y ajustar.
Benchmark propio, sin verificar
La comparación con Nano Banana 2.0 sale de un benchmark interno de la propia Alibaba. Es la compañía la que mide y la que publica el resultado, así que conviene tomarlo como una declaración de intenciones y no como un dato independiente. Hasta ahora no ha habido una verificación externa del rendimiento frente a los modelos cerrados con los que se compara.
Lo que sí se puede contrastar son las pruebas preliminares que han ido apareciendo en la arena de texto a imagen, donde el modelo se sitúa en un rango competitivo frente a otros modelos de imagen abiertos. No es lo mismo que ganar a un sistema cerrado en su terreno, pero indica que no se queda descolgado.
En características, dos cosas destacan sobre el papel: soporte nativo de transparencia, algo que no todos los modelos de difusión resuelven bien, y la capacidad de componer una imagen unificada a partir de varias imágenes de referencia. Esto último apunta a flujos donde se quiere mantener la coherencia de un personaje o de un objeto entre distintas generaciones, un caso de uso habitual en producción de contenido.
El interés para quien administra infraestructura o construye producto está en el coste. Un modelo de este tamaño que corre en hardware que ya está en el rack cambia la ecuación frente a pagar por generación de imágenes en la nube, sobre todo si el volumen es alto o si hay requisitos de privacidad sobre las imágenes de entrada. La pregunta que queda abierta es la de siempre en este tramo: cuánto aguanta el modelo en cargas reales y si su calidad se mantiene cuando se le saca del conjunto de pruebas con el que se ha evaluado.


