No dia 20 de setembro de 2026, a equipa Qwen da Alibaba lançou o Qwen-Image-2.1 em código aberto. É um modelo de imagem 7B que gera e edita num único pipeline, aceita até 10 imagens de referência e aponta o provador virtual como um caso de uso principal.
Testámo-lo com os oito pares de pessoa e peça de roupa que usamos para avaliar qualquer motor, lado a lado com o modelo de provador virtual do Vertex AI da Google, uma das opções comerciais mais comuns. Mesmas fotos, mesmo pipeline de prompts, sem fine-tuning.

O que é o Qwen-Image-2.1?
O Qwen-Image-2.1 substitui três modelos anteriores (Qwen-Image para geração, Qwen-Image-Edit para edição e Qwen-Image-Layered para transparência) num só checkpoint.
- 7B parâmetros no componente de geração (32 camadas DiT num fluxo único). O Qwen3-VL 8B lê o prompt e as imagens de entrada.
- Até 10 imagens de referência numa edição. Da página de lançamento: «para provador virtual, cinco entradas (um modelo, roupa, sapatos, uma mala e um chapéu) podem ser combinadas num conjunto completo.»
- Edição de região. Circule uma área, pinte sobre ela ou passe uma máscara em separado, e apenas essa região sofre alterações.
- Fidelidade para pessoas e produtos é um objetivo explícito do treino: os rostos mantêm-se iguais entre edições, o «texto, as texturas e a forma» do produto são preservados.
- Transparência nativa. Saída RGBA a partir de um prompt e extração do sujeito a partir de uma foto como camada transparente.
- Inferência eficiente. As imagens de entrada e a instrução são codificadas uma vez e guardadas em cache para cada passo de redução de ruído, por isso uma edição com dez referências tem um custo por passo idêntico a uma com apenas uma referência.
No Qwen-Image-Bench da própria equipa, regista 60,28 pontos, sendo o sétimo entre 29 modelos. Os seis à sua frente são de código fechado (o GPT Image 2.5 lidera com 67,01). Entre os modelos open-weight, fica em primeiro lugar com uma margem folgada.

Este é um benchmark auto-reportado e mede a geração, não a edição. Os pesos estão no Hugging Face e no ModelScope, com suporte no lançamento no Diffusers, ComfyUI, vLLM-Omni e SGLang.
A licença é a Qwen Research License, «apenas para fins não comerciais». A utilização comercial exige um acordo em separado com a Alibaba. Mais informações abaixo.
Funciona para provador virtual?
Sim, zero-shot.
Configuração: oito pares dos nossos exemplos públicos de provador, cada um com uma selfie ao espelho mais a imagem do produto tal como um lojista a carregaria (uma foto da peça plana ou uma foto num modelo). O Qwen-Image-2.1 correu na Comfy Cloud a 16 passos. O Vertex AI correu através da sua API. Ambos passaram pelo mesmo pipeline de prompts, sem LoRA e sem pós-processamento. Cada painel lê-se da esquerda para a direita: foto do comprador, imagem do produto, Qwen-Image-2.1, Google Vertex AI.
A camisola de futebol no topo do artigo é o teste do texto. Ambos os modelos mantêm o logótipo do patrocinador e o emblema perfeitamente legíveis e no sítio certo, e nenhum altera as mãos do comprador, o telemóvel ou o fundo.

Onde o Qwen sai a ganhar. A abaya está fotografada num modelo que usa um lenço cor de creme. O Vertex transferiu o lenço em conjunto com a peça. O Qwen apenas alterou a abaya.

Onde o Qwen se sai pior. A foto do produto tem um corte a meio da barriga da perna. O Vertex mantém o comprimento, o Qwen para pelo joelho. Cinto, fecho e abas estão corretos em ambos. O comprimento da bainha em peças compridas foi a única falha sistemática, e repetiu-se num vestido comprido com camadas.
Os outros cinco pares (um vestido floral pelo joelho, um capuz fluorescente, um sari de duas peças, um vestido comprido plus-size, um vestido de noiva em renda) terminaram num empate. Ambos transferiram a blusa e a bainha do sari, ambos acertaram na escala do padrão do vestido floral, nenhum desfigurou o rosto.
Qwen-Image-2.1 vs. Google Vertex AI no provador virtual
| Qwen-Image-2.1 na Comfy Cloud | Provador virtual Google Vertex AI | |
|---|---|---|
| Pares concluídos | 8 de 8 | 8 de 8 |
| Tempo mediano por prova | 9,9 s | 9,3 s |
| Custo por prova | cerca de $0,005 (tempo de GPU) | $0,06 (preço de tabela) |
| Qualidade, lado a lado | 6 empates, 1 melhor, 1 pior | 6 empates, 1 melhor, 1 pior |
| Pesos | abertos, podem levar fine-tuning | API fechada |
| Licença | apenas investigação, comercial mediante acordo | comercial |
O tempo do Qwen inclui cerca de três segundos em fila de espera na Comfy Cloud. O custo do Qwen diz respeito ao tempo de GPU apenas para o modelo; um pedido completo de provador corre também uma classificação da roupa, a construção do prompt e validações de qualidade.
A letra miudinha
Licença. O Qwen-Image-2.1 é distribuído com a Qwen Research License Agreement, não com a Apache 2.0 como o Qwen-Image-Edit-2511. O ficheiro da licença permite a utilização «apenas para fins não comerciais», definido como investigação ou avaliação, e indica que os utilizadores comerciais devem pedir uma licença à Alibaba. Ter um botão de provador numa loja virtual é uso comercial. Acolher a solução em servidores próprios exige esse acordo.
As duas falhas. O comprimento das bainhas nas peças compridas e a ausência de peças secundárias nalguns produtos de várias peças. Ambas são falhas sistemáticas, o cenário perfeito para usar um LoRA. Com 7B, é possível treinar um adaptador numa única GPU em apenas algumas horas. O DiffSynth-Studio da ModelScope tem suporte para o treino com LoRA no 2.1 desde o dia de lançamento, e o ComfyUI carrega os adaptadores nos seus nós habituais. Os dados de treino consistem numa foto no modelo juntamente com a foto da peça plana correspondente, coisa que os catálogos de moda já têm. Um prompt que indique a categoria da roupa, o tipo de fecho e o comprimento corrige logo à partida a maior parte dos erros nas bainhas; o resto resolve-se com o LoRA.
O que isto significa para o Genlook
O Qwen-Image-2.1 é o primeiro modelo aberto a conseguir um empate com uma API de provador comercial nos nossos pares, tudo isto a uma fração do custo por imagem. Estamos a atualizar o pipeline de provador do Genlook para o usar nas áreas em que apresenta melhores resultados, juntando-lhe a classificação da roupa, a construção dos prompts e as validações de qualidade que envolvem qualquer modelo, por forma a garantir a melhor qualidade de provador possível a qualquer tipo de produto. O trabalho no pipeline arrancou precisamente por colmatar as duas falhas apontadas em cima.
Para os programadores, a API de Provador Virtual da Genlook oferece um único endpoint para todos os tipos de produto. Um crédito equivale a um provador: $0,04 em modelo pré-pago ou a partir de $0,015 num plano mensal. Os pacotes de créditos não expiram e as novas contas arrancam com créditos gratuitos. O início rápido faz-se com quatro chamadas: criar um produto, carregar a foto, gerar, ir buscar o resultado.
Resumo
- O lançamento: um modelo open-weight 7B que gera, edita com o apoio de até 10 referências e trata da transparência num só checkpoint. É o melhor modelo aberto de acordo com o benchmark da equipa.
- No provador: iguala o modelo Vertex AI da Google em 6 de 8 pares em zero-shot. Sai a ganhar por não mexer nos objetos que não são roupa, perde no comprimento da bainha de peças mais compridas.
- Custo: cerca de $0,005 em tempo de GPU por imagem face aos $0,06 da Google.
- A letra miudinha: tem licença exclusiva para investigação para quem o hospedar e falha em dois detalhes que se corrigem com um LoRA.
Obtenha uma chave da API em platform.genlook.app para usar a API de Provador Virtual da Genlook ou adicione o provador virtual à sua loja.
FAQ