Technology发布于 September 21, 2026作者:Thibault Mathian

Qwen-Image-2.1 虚拟试衣:测试结果

阿里巴巴于2026年9月20日开源了 Qwen-Image-2.1。我们使用8组试衣对比图将其与 Google Vertex AI 虚拟试衣模型进行了测试。本文涵盖测试结果、成本分析及许可协议注意事项。

目录

2026年9月20日,阿里巴巴 Qwen 团队开源了 Qwen-Image-2.1。这是一款拥有 7B 参数的图像模型,将生成与编辑集成在单一流程中,最多支持 10 张参考图像,并明确将虚拟试衣作为目标应用场景之一。

我们将它与市面上最主流的商业方案之一 —— Google Vertex AI 的虚拟试衣模型进行了横向对比。测试使用了我们所有引擎都在跑的8组“人物与服装”经典图片对。测试条件完全一致:同样的图片,同样的提示词流程,均未经过微调。

足球服试衣。从左至右:买家照片、商品平铺图、Qwen-Image-2.1 结果、Google Vertex AI 结果。
足球服试衣。从左至右:买家照片、商品平铺图、Qwen-Image-2.1 结果、Google Vertex AI 结果。

Qwen-Image-2.1 是什么?

Qwen-Image-2.1 用一个模型取代了此前的三个早期模型(用于生成的 Qwen-Image、用于编辑的 Qwen-Image-Edit 以及处理透明度的 Qwen-Image-Layered)。

  • 7B 参数的生成组件(32 层单流 DiT)。由 Qwen3-VL 8B 负责读取提示词与输入图像。
  • **单次编辑最多 10 张参考图。**正如发布页面所述:“针对虚拟试衣,可将五个输入(模特、衣服、鞋子、包和帽子)组合成一套完整的穿搭。”
  • **局部编辑。**圈选区域、涂抹或传入独立遮罩,即可仅对目标区域进行修改。
  • 人物与商品的高保真度是其核心训练目标:在编辑过程中保持面部特征不变,并完美保留商品的“文本、纹理与形状”。
  • **原生透明度支持。**不仅能通过提示词输出带有 RGBA 通道的图片,还可以将照片中的主体直接提取为透明图层。
  • **高效推理。**输入图像与指令只需编码一次并在降噪步骤中缓存,因此带有 10 张参考图的编辑,单步成本与单张参考图几乎相同。

在团队自己的 Qwen-Image-Bench 测试中,它得分为 60.28,在 29 个模型中排名第七。排在前面的六个均为闭源模型(GPT Image 2.5 以 67.01 领跑)。而在开源模型中,它以绝对优势位列第一。

开源图像模型的 Qwen-Image-Bench 得分及其参数量对比。Qwen-Image-2.1 凭借 7B 参数以 60.28 分领跑。
开源图像模型的 Qwen-Image-Bench 得分及其参数量对比。Qwen-Image-2.1 凭借 7B 参数以 60.28 分领跑。

这是一项基于自评的基准测试,且主要衡量的是生成而非编辑能力。目前权重已上线 Hugging Face 与 ModelScope,Diffusers、ComfyUI、vLLM-Omni 以及 SGLang 均已在首日提供支持。

该模型采用 Qwen Research License 协议,“仅限非商业用途”。若需投入商业使用,必须与阿里巴巴另行签署协议。详情见后文。

它能做好虚拟试衣吗?

能,而且是零样本(zero-shot)直出。

测试设定:选取公开试衣图库中的 8 组图对,每组包含一张对镜自拍以及商家上传的商品原图(平铺图或模特图)。Qwen-Image-2.1 在 Comfy Cloud 上运行,步数为 16。Vertex AI 通过其 API 调用。两者使用相同的提示词流程,无 LoRA,无后处理。每组对比图从左至右依次为:买家照片、商品图片、Qwen-Image-2.1、Google Vertex AI。

文章开头的足球服是针对文字保留的测试。两个模型都成功保持了赞助商标志和队徽的清晰与位置准确,且都没有改变买家的手部、手机或背景。

长袍试衣。从左至右:买家照片、搭配奶油色头巾的模特图、仅替换长袍的 Qwen-Image-2.1 结果、连同头巾一起添加的 Google Vertex AI 结果。
长袍试衣。从左至右:买家照片、搭配奶油色头巾的模特图、仅替换长袍的 Qwen-Image-2.1 结果、连同头巾一起添加的 Google Vertex AI 结果。

**Qwen 表现更好的地方。**商品图中的模特穿着长袍并佩戴了奶油色头巾。Vertex 把头巾连同衣服一起带了过来。而 Qwen 仅替换了长袍,没有画蛇添足。

风衣试衣。从左至右:买家照片、平铺图、长度及膝的 Qwen-Image-2.1 结果、保持小腿中段长度的 Google Vertex AI 结果。
风衣试衣。从左至右:买家照片、平铺图、长度及膝的 Qwen-Image-2.1 结果、保持小腿中段长度的 Google Vertex AI 结果。

**Qwen 表现不足的地方。**平铺图的风衣长度到小腿中段。Vertex 准确还原了长度,但 Qwen 却在膝盖处截断了。不过两者的腰带、门襟和翻领细节都很准确。对于长款服装的下摆长度控制不准是它唯一持续出现的失误,这在另一件多层长裙测试中也再次暴露。

其余五组图(碎花中裙、荧光卫衣、两件套纱丽、大码长裙、蕾丝婚纱)两者难分伯仲。它们都保留了纱丽的内搭和边缘,准确还原了中裙的印花比例,且都没有改变人物的面部。

Qwen-Image-2.1 对比 Google Vertex AI 虚拟试衣

Qwen-Image-2.1 (Comfy Cloud)Google Vertex AI 虚拟试衣
完成组数8 / 88 / 8
单次试衣中位时间9.9 秒9.3 秒
单次试衣成本约 $0.005 (GPU 耗时)$0.06 (标价)
并排质量盲测6 次平局,1 次胜出,1 次落败6 次平局,1 次胜出,1 次落败
权重开源,可微调闭源 API
许可协议仅限研究,商用需授权商业许可

Qwen 的耗时包含了在 Comfy Cloud 上约 3 秒的排队时间。Qwen 的成本仅为模型本身的 GPU 耗时;一个完整的试衣请求还需要进行服装分类、提示词构建与质量检查。

协议限制与不足

**许可协议。**Qwen-Image-2.1 采用的是 Qwen Research License Agreement,而非 Qwen-Image-Edit-2511 所用的 Apache 2.0。协议明确规定“仅限非商业用途”,即仅供研究或评估,商用则需向阿里巴巴申请许可。在网店中添加试衣按钮显然属于商业行为。自行部署也同样受该协议约束。

**两处不足。**长款衣物的下摆长度问题,以及在多部件商品中丢失次要单品。这两点属于系统性偏差,但这正是 LoRA 能大显身手的地方。对于 7B 参数的模型,只需单张 GPU 几个小时即可练好一个适配器。ModelScope 的 DiffSynth-Studio 在首日就支持了 2.1 的 LoRA 训练,ComfyUI 也能通过标准节点加载适配器。训练数据只需使用模特图及对应的平铺图,这在时尚图册中现成就有。在提示词中明确服装品类、闭合方式及长度就能解决大部分下摆问题;剩下的则可以交由 LoRA 搞定。

这对 Genlook 意味着什么

Qwen-Image-2.1 是首个在我们的图对测试中,质量追平商业试衣 API 且单张成本远低于后者的开源模型。我们正在升级 Genlook 的试衣管线,在它表现更优的场景下接入该模型。配合环绕在模型周围的服装分类、提示词构建与质量检查机制,确保每一种商品类型都能获得最极致的试衣效果。上述的两处不足,正是管线升级首要攻克的目标。

对开发者而言,Genlook Try-On API 为各类商品提供统一接口。1 个点数对应 1 次试衣,单价为 $0.01。零平台费、无座席限制、无月度最低消费,点数永久有效,新注册账户均享免费点数。快速入门指南仅需四次调用即可跑通:创建商品、上传照片、生成、获取结果。

总结

  • **发布亮点:**7B 开源权重模型,在单个模型中搞定生成、支持最多 10 张图的编辑,并处理透明度。在官方基准测试中排名开源模型榜首。
  • **试衣表现:**零样本下,8 组对比有 6 组追平 Google Vertex AI。在不乱改非服装物品上表现更好,在长款服装的下摆长度控制上稍逊一筹。
  • **成本对比:**每张图片约 $0.005 的 GPU 耗时,对比 API 的 $0.06 标价。
  • **注意事项:**自托管用户受限于研究协议,模型自身的两处偏差需要通过 LoRA 来修正。

前往 platform.genlook.app 获取 API 密钥 以体验 Genlook Try-On API,或 为您的店铺添加虚拟试衣功能

常见问题

常见问题解答。

Qwen-Image-2.1 能用于虚拟试衣吗?
Qwen-Image-2.1 可以免费商用吗?
Qwen-Image-2.1 与 Google Vertex AI 虚拟试衣相比如何?
可以使用 LoRA 对 Qwen-Image-2.1 进行微调吗?
Genlook Try-On API 的收费标准是什么?

准备好减少退货并提升转化率了吗?

只需几分钟即可在您的 Shopify 店铺安装 Genlook。从免费套餐开始。

相关文章