No dia 20 de setembro de 2026, a equipa Qwen da Alibaba lançou o Qwen-Image-2.1 em código aberto. Trata-se de um modelo de imagem de 7 mil milhões de parâmetros (7B) que gera e edita num único fluxo de trabalho, suporta até 10 imagens de referência e aponta o provador virtual como um dos principais casos de uso.
Testamo-lo nos oito pares de pessoa e peça de roupa que utilizamos para todos os motores, lado a lado com o modelo de provador virtual da Google no Vertex AI, uma das opções comerciais mais comuns. As mesmas fotografias, o mesmo processo de comandos, sem qualquer ajuste fino (fine-tuning).

O que é o Qwen-Image-2.1?
O Qwen-Image-2.1 substitui três modelos anteriores (Qwen-Image para geração, Qwen-Image-Edit para edição, Qwen-Image-Layered para transparência) num único checkpoint.
- 7B de parâmetros na componente de geração (32 camadas DiT de fluxo único). O Qwen3-VL 8B lê as instruções e as imagens de entrada.
- Até 10 imagens de referência numa única edição. Segundo a página de lançamento: "para o provador virtual, é possível combinar cinco elementos (um modelo, roupa, sapatos, uma mala e um chapéu) num conjunto completo."
- Edição de regiões. Contorne uma área, pinte sobre ela ou utilize uma máscara separada, e apenas essa zona será alterada.
- Fidelidade de pessoas e produtos é um objetivo declarado no treino: os rostos mantêm-se iguais entre edições, e o "texto, texturas e forma" dos produtos são preservados.
- Transparência nativa. Saída RGBA a partir de um comando e extração do sujeito de uma foto como uma camada transparente.
- Inferência eficiente. As imagens de entrada e a instrução são codificadas apenas uma vez e guardadas em cache para cada etapa de eliminação de ruído, pelo que uma edição com dez referências tem um custo por etapa muito semelhante a uma edição com apenas uma.
No próprio Qwen-Image-Bench da equipa, obtém a pontuação de 60,28, ocupando o sétimo lugar entre 29 modelos. Os seis primeiros são de código fechado (o GPT Image 2.5 lidera com 67,01). Entre os modelos de pesos abertos, é de longe o primeiro.

Esta avaliação é reportada pela própria equipa e mede a geração, não a edição. Os pesos estão disponíveis no Hugging Face e no ModelScope, com suporte desde o primeiro dia no Diffusers, ComfyUI, vLLM-Omni e SGLang.
A licença é a Qwen Research License, "apenas para fins não comerciais". O uso comercial exige um acordo em separado com a Alibaba. Mais detalhes abaixo.
Funciona para o provador virtual?
Sim, em modo zero-shot (sem treino específico prévio).
Configuração: oito pares dos nossos exemplos públicos de provador, cada um composto por uma selfie ao espelho e a imagem do produto tal como o lojista a carregaria (uma fotografia plana ou num modelo). O Qwen-Image-2.1 correu na Comfy Cloud com 16 passos. O Vertex AI funcionou através da sua API. Ambos passaram pelo mesmo processo de comandos, sem LoRA e sem pós-processamento. Cada painel lê-se da esquerda para a direita: foto do cliente, imagem do produto, Qwen-Image-2.1, Google Vertex AI.
A camisola de futebol no topo do artigo é o teste de texto. Ambos os modelos mantêm a marca do patrocinador e o emblema legíveis e no sítio certo, e nenhum deles altera as mãos, o telemóvel ou o fundo do cliente.

Onde o Qwen se sai melhor. A abaya foi fotografada numa modelo a usar um lenço creme. O Vertex transferiu o lenço juntamente com a peça de roupa. O Qwen alterou a abaya e mais nada.

Onde o Qwen se sai pior. A fotografia plana tem o comprimento a meio da barriga da perna. O Vertex mantém esse comprimento, o Qwen para pelo joelho. O cinto, o fecho e as lapelas estão corretos em ambos. O comprimento da bainha em peças compridas foi a única falha constante, e voltou a surgir num vestido comprido de folhos.
Os outros cinco pares (um vestido midi floral, um capuz néon, um sari de duas peças, um vestido comprido plus-size, um vestido de noiva em renda) não conseguimos desempatar. Ambos mantiveram a blusa e a margem do sari, ambos acertaram na escala do padrão do vestido midi, e nenhum alterou um rosto.
Qwen-Image-2.1 vs Google Vertex AI provador virtual
| Qwen-Image-2.1 na Comfy Cloud | Provador virtual do Google Vertex AI | |
|---|---|---|
| Pares concluídos | 8 de 8 | 8 de 8 |
| Tempo mediano por teste | 9,9 s | 9,3 s |
| Custo por teste | cerca de $0,005 (tempo de GPU) | $0,06 (preço de tabela) |
| Qualidade, lado a lado | 6 empates, 1 melhor, 1 pior | 6 empates, 1 melhor, 1 pior |
| Pesos | abertos, pode ser ajustado | API fechada |
| Licença | apenas investigação, comercial mediante acordo | comercial |
O tempo do Qwen inclui cerca de três segundos de fila de espera na Comfy Cloud. O custo do Qwen refere-se apenas ao tempo de GPU para o modelo; um pedido completo de provador também executa classificação da peça, construção da instrução e verificações de qualidade.
As condições
Licença. O Qwen-Image-2.1 é distribuído ao abrigo do Acordo de Licença de Investigação Qwen (Qwen Research License Agreement), e não da licença Apache 2.0 como o Qwen-Image-Edit-2511. O ficheiro de licença permite o uso "apenas para fins não comerciais", definido como investigação ou avaliação, e orienta os utilizadores comerciais a solicitar uma licença à Alibaba. Um botão de provador numa loja online é uso comercial. O alojamento próprio (self-hosting) exige esse acordo.
As duas falhas. O comprimento da bainha em peças compridas, e a perda de peças secundárias em alguns produtos de várias partes. Ambas são sistemáticas, e é para isso que serve um LoRA. Com 7B, um adaptador treina numa única GPU em poucas horas. O DiffSynth-Studio da ModelScope suporta o treino de LoRA no 2.1 desde o primeiro dia e o ComfyUI carrega os adaptadores através dos seus nós padrão. Os dados de treino consistem numa foto num modelo combinada com a fotografia plana correspondente, algo que os catálogos de moda já possuem. Um comando que indique a categoria da peça, o fecho e o comprimento resolve a maioria das falhas da bainha por si só; um LoRA trata do resto.
O que isto significa para a Genlook
O Qwen-Image-2.1 é o primeiro modelo aberto a igualar uma API de provador comercial nos nossos pares, por uma fração do custo por imagem. Estamos a atualizar o processo de provador da Genlook para o usar onde é mais forte, em conjunto com a classificação da peça, construção de instruções e verificações de qualidade que envolvem qualquer modelo, para que cada tipo de produto obtenha a melhor qualidade de provador possível. As duas falhas mencionadas são os primeiros aspetos que o trabalho no fluxo pretende resolver.
Para os programadores, a API de Provador Genlook é um único endpoint para todos os tipos de produto. Um crédito equivale a uma prova, e custa $0,01. Sem taxa de plataforma, sem licença por utilizador, sem mínimo mensal, os créditos não expiram, e as novas contas começam com créditos gratuitos. O início rápido consiste em quatro chamadas: criar um produto, carregar uma foto, gerar, obter o resultado.
Resumo
- O lançamento: um modelo de pesos abertos de 7B que gera, edita com até 10 referências e gere a transparência num único checkpoint. O melhor modelo aberto no benchmark da equipa.
- No provador: iguala o modelo Vertex AI da Google em 6 de 8 pares em modo zero-shot. Melhor a não alterar elementos que não são roupa, pior no comprimento da bainha em roupas compridas.
- Custo: cerca de $0,005 em tempo de GPU por imagem face aos $0,06.
- A condição: uma licença exclusiva para investigação em caso de alojamento próprio, e duas falhas que um LoRA deverá resolver.
Obtenha uma chave de API em platform.genlook.app para utilizar a API de Provador Genlook, ou adicione o provador virtual à sua loja.
FAQ