TechnologyPublicado el September 21, 2026Por Thibault Mathian

Qwen-Image-2.1 para probadores virtuales: resultados de las pruebas

Alibaba lanzó la versión de código abierto de Qwen-Image-2.1 el 20 de septiembre de 2026. Lo probamos en ocho prendas frente al modelo de prueba virtual Vertex AI de Google. Resultados, costes y las condiciones de la licencia.

Tabla de contenidos

El 20 de septiembre de 2026, el equipo de Qwen en Alibaba lanzó en código abierto Qwen-Image-2.1. Se trata de un modelo de imágenes de 7B que genera y edita en un único proceso, admite hasta 10 imágenes de referencia y señala a los probadores virtuales como uno de sus casos de uso principales.

Lo probamos con los ocho conjuntos de persona y prenda que usamos para evaluar cada motor, y lo comparamos con el modelo de prueba virtual de Google en Vertex AI, una de las opciones comerciales más habituales. Mismas fotos, mismo proceso de prompts y sin reentrenamiento (fine-tuning).

Prueba de una camiseta de fútbol. De izquierda a derecha: foto del cliente, foto del producto, resultado de Qwen-Image-2.1, resultado de Google Vertex AI.
Prueba de una camiseta de fútbol. De izquierda a derecha: foto del cliente, foto del producto, resultado de Qwen-Image-2.1, resultado de Google Vertex AI.

¿Qué es Qwen-Image-2.1?

Qwen-Image-2.1 sustituye a tres modelos anteriores (Qwen-Image para generación, Qwen-Image-Edit para edición y Qwen-Image-Layered para transparencias) en un único checkpoint.

  • 7B de parámetros en el componente de generación (32 capas DiT de flujo único). Qwen3-VL 8B se encarga de interpretar el prompt y las imágenes de entrada.
  • Hasta 10 imágenes de referencia en una sola edición. Según las notas de la versión: «para los probadores virtuales, se pueden combinar cinco entradas (modelo, ropa, zapatos, bolso y sombrero) para crear un conjunto completo».
  • Edición por zonas. Puedes rodear un área, pintar sobre ella o usar una máscara para que los cambios se apliquen solo a esa parte.
  • Fidelidad de personas y productos, que es un objetivo declarado en su entrenamiento: los rostros se mantienen idénticos en las ediciones y se conservan el «texto, las texturas y la forma» del producto.
  • Transparencia nativa. Salida RGBA a partir de un prompt y extracción del sujeto de una foto como capa transparente.
  • Inferencia eficiente. Las imágenes de entrada y la instrucción se codifican una sola vez y se guardan en caché para cada paso de reducción de ruido (denoising), por lo que una edición con diez referencias cuesta casi lo mismo por paso que una con una sola referencia.

En la propia prueba de evaluación del equipo, Qwen-Image-Bench, obtiene una puntuación de 60,28, situándose en el séptimo puesto de 29 modelos. Los seis que le superan son modelos cerrados (GPT Image 2.5 lidera con 67,01). Entre los modelos de pesos abiertos, ocupa el primer puesto con un amplio margen.

Puntuaciones en Qwen-Image-Bench de los modelos de imagen de pesos abiertos junto a su número de parámetros. Qwen-Image-2.1 encabeza la lista con 60,28 y 7B de parámetros.
Puntuaciones en Qwen-Image-Bench de los modelos de imagen de pesos abiertos junto a su número de parámetros. Qwen-Image-2.1 encabeza la lista con 60,28 y 7B de parámetros.

Se trata de un benchmark elaborado por ellos mismos y mide la generación, no la edición. Los pesos están disponibles en Hugging Face y ModelScope, con soporte desde el primer día en Diffusers, ComfyUI, vLLM-Omni y SGLang.

La licencia aplicable es la Qwen Research License, «exclusivamente para fines no comerciales». El uso comercial requiere un acuerdo independiente con Alibaba. A continuación, más detalles.

¿Sirve para probadores virtuales?

Sí, sin necesidad de entrenamiento previo (zero-shot).

Configuración: ocho combinaciones de nuestros ejemplos públicos de prueba virtual. Cada una consta de un selfi en el espejo y la imagen del producto tal como la subiría un vendedor (una foto del producto sobre una superficie plana o en un modelo). Qwen-Image-2.1 se ejecutó en Comfy Cloud a 16 pasos. Vertex AI se usó a través de su API. Ambos pasaron por el mismo proceso de prompts, sin LoRA ni posprocesamiento. Cada panel muestra, de izquierda a derecha: la foto del comprador, la imagen del producto, Qwen-Image-2.1 y Google Vertex AI.

La camiseta de fútbol al principio del artículo corresponde a la prueba de texto. Ambos modelos mantienen legible y en su sitio el logotipo del patrocinador y el escudo, y ninguno altera las manos del cliente, el móvil ni el fondo.

Prueba de una abaya. De izquierda a derecha: foto de la clienta, foto del producto en un modelo con un pañuelo crema, resultado de Qwen-Image-2.1 modificando solo la abaya, resultado de Google Vertex AI añadiendo también el pañuelo.
Prueba de una abaya. De izquierda a derecha: foto de la clienta, foto del producto en un modelo con un pañuelo crema, resultado de Qwen-Image-2.1 modificando solo la abaya, resultado de Google Vertex AI añadiendo también el pañuelo.

En qué destaca Qwen. La abaya aparece fotografiada en un modelo que lleva un pañuelo de color crema. Vertex incorporó el pañuelo junto con la prenda. Qwen modificó únicamente la abaya.

Prueba de una gabardina. De izquierda a derecha: foto de la clienta, foto del producto plano, resultado de Qwen-Image-2.1 parando a la altura de la rodilla, resultado de Google Vertex AI manteniendo la longitud a media pantorrilla.
Prueba de una gabardina. De izquierda a derecha: foto de la clienta, foto del producto plano, resultado de Qwen-Image-2.1 parando a la altura de la rodilla, resultado de Google Vertex AI manteniendo la longitud a media pantorrilla.

En qué falla Qwen. En la foto del producto, la gabardina llega a media pantorrilla. Vertex respeta ese largo, mientras que Qwen lo recorta a la altura de la rodilla. Tanto el cinturón como el cierre y las solapas son correctos en ambos casos. La longitud del bajo en prendas largas fue el único error recurrente, repitiéndose también en un vestido largo de volantes.

En cuanto a las otras cinco prendas (un vestido midi de flores, una sudadera flúor, un sari de dos piezas, un vestido largo de talla grande y un vestido de novia de encaje), los resultados fueron un empate. Ambos incluyeron la blusa y el borde del sari, acertaron con la escala del estampado en el vestido midi y ninguno modificó los rostros.

Qwen-Image-2.1 frente al probador virtual de Google Vertex AI

Qwen-Image-2.1 en Comfy CloudProbador virtual de Google Vertex AI
Combinaciones completadas8 de 88 de 8
Tiempo medio por prueba9,9 s9,3 s
Coste por pruebaAprox. 0,005 $ (tiempo de GPU)0,06 $ (precio de catálogo)
Calidad, lado a lado6 empates, 1 mejor, 1 peor6 empates, 1 mejor, 1 peor
PesosAbiertos, puede hacerse fine-tuningAPI cerrada
LicenciaSolo para investigación, comercial bajo acuerdoComercial

El tiempo de Qwen incluye unos tres segundos de espera en la cola de Comfy Cloud. El coste de Qwen se calcula en base al tiempo de GPU dedicado únicamente al modelo; una solicitud de prueba completa también incluye la clasificación de la prenda, la creación del prompt y comprobaciones de calidad.

El truco

Licencia. Qwen-Image-2.1 se distribuye bajo el acuerdo de licencia Qwen Research, y no bajo Apache 2.0 como Qwen-Image-Edit-2511. El documento de licencia permite su uso «exclusivamente para fines no comerciales», lo que abarca la investigación o evaluación, y requiere que los usuarios comerciales soliciten una licencia a Alibaba. Añadir un botón de prueba virtual en una tienda online se considera un uso comercial. Del mismo modo, el autoalojamiento (self-hosting) precisa dicho acuerdo.

Los dos fallos. La longitud del bajo en las prendas largas y la omisión de elementos secundarios en algunos artículos de varias piezas. Como ambos problemas son sistemáticos, se pueden solucionar con un LoRA. Con 7B de parámetros, un adaptador se entrena en unas horas usando una sola GPU. DiffSynth-Studio de ModelScope permite entrenar modelos LoRA en la versión 2.1 desde el primer momento, y ComfyUI carga los adaptadores mediante sus nodos estándar. Los datos de entrenamiento consisten en emparejar una foto del producto en un modelo con la imagen correspondiente del artículo suelto, algo que los catálogos de moda ya suelen tener. Un prompt que especifique la categoría de la prenda, el tipo de cierre y su longitud soluciona la mayoría de los errores del bajo; un LoRA se encarga del resto.

Qué implica esto para Genlook

Qwen-Image-2.1 es el primer modelo abierto que logra igualar a una API de probador comercial en nuestras combinaciones de prueba, con un coste por imagen considerablemente inferior. Estamos actualizando el sistema de prueba de Genlook para integrarlo donde ofrezca mejores resultados, sumado a la clasificación de prendas, la redacción de prompts y los controles de calidad que aplicamos a todos los modelos, para garantizar que cada categoría de producto reciba la máxima calidad en la prueba virtual. Los dos fallos mencionados son las primeras áreas que abordará esta actualización.

Para los desarrolladores, la API de probador virtual de Genlook es un punto de acceso único para cualquier tipo de producto. Un crédito equivale a una prueba: 0,04 $ si pagas según uso, o desde 0,015 $ con una suscripción mensual. Los créditos de los paquetes no caducan y las nuevas cuentas empiezan con créditos de regalo. La guía de inicio rápido requiere cuatro pasos: crear un producto, subir una foto, generar y obtener el resultado.

Resumen

  • El lanzamiento: un modelo de pesos abiertos de 7B que genera, edita usando hasta 10 referencias y gestiona las transparencias desde un único checkpoint. Es el mejor modelo abierto según la evaluación del propio equipo.
  • En la prueba virtual: iguala al modelo Vertex AI de Google en 6 de 8 casos sin entrenamiento previo (zero-shot). Es mejor a la hora de no alterar elementos ajenos a la ropa, pero rinde peor ajustando el bajo de las prendas largas.
  • Coste: aproximadamente 0,005 $ de tiempo de GPU por imagen, frente a los 0,06 $.
  • El truco: una licencia limitada a la investigación para el autoalojamiento y dos errores que deberían poder corregirse con un modelo LoRA.

Obtén una clave de API en platform.genlook.app para usar la API de probador virtual de Genlook o añade el probador a tu tienda online.

FAQ

Preguntas, respondidas.

¿Puede Qwen-Image-2.1 funcionar como probador virtual?↓
¿El uso comercial de Qwen-Image-2.1 es gratuito?↓
¿Cómo rinde Qwen-Image-2.1 en comparación con el probador virtual de Google Vertex AI?↓
¿Se puede aplicar *fine-tuning* a Qwen-Image-2.1 con un LoRA?↓
¿Cuánto cuesta la API de probador de Genlook?↓

¿Listo para reducir devoluciones y aumentar conversiones?

Instala Genlook en tu tienda Shopify en minutos. Empieza con nuestro plan gratuito.

Artículos relacionados