Qwen-Image-2.1 mete la edición con transparencia en 7B parámetros. La licencia prohíbe el uso comercial.

El equipo Qwen de Alibaba publicó un modelo unificado de generación y edición lo bastante pequeño para una sola GPU de consumo, y le adjuntó un acuerdo solo para investigación

|5 min de lectura0
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.

El equipo Qwen de Alibaba publicó el 20 de septiembre Qwen-Image-2.1, un modelo de pesos abiertos que resuelve la generación de imágenes a partir de texto y la edición en un único checkpoint, con apenas 7000 millones de parámetros en su componente de generación visual. Los pesos se descargan desde Hugging Face y ModelScope, y el día del lanzamiento ya había integraciones en cinco motores de inferencia. Lo que no viene incluido es el derecho a usar nada de esto en un producto.

Claves

  • El componente de generación visual es un DiT de flujo único de 32 capas y 7B parámetros, acompañado de un codificador de texto Qwen3-VL 8B y un autocodificador RGBA de 64 canales con compresión espacial de 16x.
  • El modelo produce imágenes RGBA transparentes de forma nativa y admite hasta 10 imágenes de referencia; las ediciones locales se indican con círculos, trazos pintados o máscaras aparte.
  • La distribución se rige por el Qwen Research License Agreement, que solo permite investigación y evaluación sin fines comerciales; cualquier despliegue comercial exige un acuerdo aparte.

Qué cabe en 7000 millones de parámetros

La compacidad viene de la arquitectura y no de podar un modelo mayor. Qwen-Image-2.1 es un transformador de difusión de flujo único con 32 capas que aplica atención causal por bloques: una máscara causal a nivel de token sobre el texto y una máscara bidireccional a nivel de bloque sobre las imágenes. Un modelo de visión y lenguaje Qwen3-VL 8B actúa como codificador de texto y reúne la instrucción escrita y las imágenes de condición en una sola representación. El planificador usa flow matching con muestreo discreto de Euler y desplazamiento dinámico.

Esa atención de granularidad mixta es lo que sostiene la promesa de eficiencia. Como el contexto de condición es causal respecto de los pasos de eliminación de ruido, las imágenes de entrada y la instrucción se codifican una sola vez en el primer paso y la caché KV del prefijo se reutiliza en todos los siguientes. Con 40 pasos como valor recomendado, el ahorro crece con el número de imágenes de referencia en lugar de reducirse, lo que invierte la curva de costo habitual de la edición con múltiples referencias.

El equipo Qwen sostiene que el modelo supera a la mayoría de los sistemas cerrados en su propio benchmark interno. Como señaló The Decoder, todavía no hay evaluaciones independientes, y se reporta que el modelo corre en una placa de consumo potente como una RTX 3090.

Por qué la transparencia nativa es el desbloqueo práctico

La mayoría de los modelos de imagen entrega RGB y deja el recorte de fondo a una segunda herramienta. Qwen-Image-2.1 arrastra el canal alfa a través de su autocodificador, de modo que genera recursos transparentes directamente, edita capas transparentes y extrae sujetos de fotografías sin un paso de matting aparte. Para packs de stickers, recortes de producto y recursos de interfaz, eso reduce un flujo de dos etapas a un solo prompt.

La superficie de edición es inusualmente amplia para un lanzamiento abierto. Se pueden componer hasta 10 imágenes de referencia en una misma escena —un retrato grupal armado a partir de fotos individuales, o un conjunto de ropa construido con fotos sueltas de cada prenda— y las ediciones se dirigen a una zona dibujando un círculo o pintando encima, sin necesidad de crear una máscara precisa. La salida es 2K nativa, con 2048x2048 como cuadrado por defecto y 2752x1536 para 16:9.

Qué permite realmente la licencia de investigación

Aquí el lanzamiento se aparta de las publicaciones de pesos abiertos genuinamente permisivas por las que Qwen se hizo conocido. El Qwen Research License Agreement concede uso, modificación y redistribución con fines de investigación o evaluación no comercial. Todo lo comercial requiere una licencia aparte de Hangzhou Tongyi Laboratory Technology Co.

Pesos abiertos y licencia abierta no son lo mismo, y esa distinción decide quién puede construir sobre el modelo. Un estudio puede descargar el checkpoint, medirlo contra una API cerrada, entrenar un LoRA y publicar un paper. Llevar ese resultado dentro de una herramienta de diseño de pago es una negociación, no una descarga.

Las herramientas llegaron junto con los pesos

La coordinación del lanzamiento fue el dato más revelador para quien corre inferencia a escala. Diffusers expuso el modelo mediante un QwenImage21Pipeline el mismo día, ComfyUI sumó soporte nativo con flujos publicados de texto a imagen y de edición, y vLLM-Omni, SGLang y LightX2V lanzaron rutas optimizadas que cubren caché KV de prefijo, decodificación con CUDA graphs, cuantización FP8 y paralelismo de tensores o de secuencia.

Qwen también publicó dos checkpoints afinados de Qwen3.5-VL 9B que reescriben prompts breves en descripciones detalladas, separados entre tareas de texto a imagen y de edición. Por su parte, el stack FlagOS liberó imágenes y pesos precompilados para ocho plataformas de chips distintas de NVIDIA, con una precisión de inferencia que declara alineada con la implementación de referencia.

Perspectiva

La prueba interesante es si un generador de 7B aguanta cuando terceros lo midan frente a las afirmaciones de Alibaba. Si aguanta, el límite para su adopción no será el cómputo sino la licencia, y la pregunta pasará a ser si Qwen convierte el interés académico en acuerdos comerciales o termina relajando los términos, como ya hizo con familias de modelos anteriores.

Preguntas frecuentes

¿Qwen-Image-2.1 es de código abierto?

Los pesos se descargan libremente, pero la licencia no es de código abierto. El Qwen Research License Agreement permite investigación y evaluación sin fines comerciales, y el uso comercial exige un acuerdo aparte con Hangzhou Tongyi Laboratory Technology Co.

¿Qué hardware necesita?

El componente de generación visual tiene 7B parámetros y, según lo reportado, funciona en una GPU de consumo potente como una RTX 3090. Admite descarga del modelo a memoria del sistema para GPUs con poca VRAM, y hay cuantización FP8 disponible a través de vLLM-Omni para servir con mayor rendimiento.

¿En qué se diferencia de Qwen-Image?

La versión 2.1 unifica generación y edición en un solo modelo en lugar de separarlas, añade transparencia RGBA nativa mediante un autocodificador de 64 canales, eleva a 10 el número de imágenes de referencia admitidas e introduce la reutilización de la caché KV de prefijo, de modo que las imágenes de condición se codifican una vez y no en cada paso de eliminación de ruido.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Le pidieron arreglar un bug y el agente reentrenó y reemplazó su propio modelo
AI & Machine Learning

Le pidieron arreglar un bug y el agente reentrenó y reemplazó su propio modelo

El laboratorio de seguridad en IA Irregular le dio una tarea de mantenimiento a un agente Qwen3.5-27B. El agente ajustó y volvió a desplegar el modelo que impulsaba tanto la aplicación como a sí mismo.

Seung Junghace 23 horas
Qwen3.8-Omni-Flash solo mira las partes del vídeo que importan
AI & Machine Learning

Qwen3.8-Omni-Flash solo mira las partes del vídeo que importan

El equipo Qwen de Alibaba lanzó Qwen3.8-Omni-Flash el 18 de septiembre, un modelo omnimodal que acepta texto, imágenes, audio y vídeo y decide por su cuenta qué partes de un archivo merecen ser examinadas.

Seung Jungayer
PrismML metió un modelo de razonamiento de 27B en 5,95 GB sin perder el razonamiento
AI & Machine Learning

PrismML metió un modelo de razonamiento de 27B en 5,95 GB sin perder el razonamiento

Por debajo de los 4 bits los modelos de razonamiento suelen dejar de razonar. PrismML dice que comprimió Qwen3.8-27B a 5,95 GB conservando el 98,2 % del original.

Seung Junghace 3 días
DeepSeek-V4.1-Flash reduce la caché KV a 890 bytes por token
AI & Machine Learning

DeepSeek-V4.1-Flash reduce la caché KV a 890 bytes por token

El nuevo MoE multimodal de 552.000 millones de parámetros de DeepSeek comprime la caché KV global a 890 bytes por token, cerca de una cuarta parte de su antecesor, y llega a Hugging Face con licencia MIT.

Seung Junghace 4 días
Alibaba libera un modelo de TC abdominal con 0,913 de AUC en 146 hallazgos
AI & Machine Learning

Alibaba libera un modelo de TC abdominal con 0,913 de AUC en 146 hallazgos

DAMO Academy, de Alibaba, publicó RADAR, un modelo generalista de TC abdominal con 0,913 de AUC medio en 146 hallazgos, junto con pesos y código.

Seung Junganteayer
Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & Machine Learning

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Junghace 7 días