2026年9月20日,阿里巴巴 Qwen 团队正式开源 Qwen-Image-2.1。这款 7B 参数的图像模型将生成与编辑功能融为一体,支持最多 10 张参考图像,并明确将虚拟试衣作为核心应用场景之一。
我们使用了测试所有引擎时的 8 组“人物+服装”标准测试集,将其与目前最主流的商业方案之一——谷歌 Vertex AI 虚拟试衣模型进行了对比。测试全程使用相同的照片和提示词流程,未经过任何微调。

Qwen-Image-2.1 是什么?
Qwen-Image-2.1 用一个模型权重(checkpoint)取代了早期的三个独立模型(负责生成的 Qwen-Image、负责编辑的 Qwen-Image-Edit 以及处理透明度的 Qwen-Image-Layered)。
- 7B 生成参数:生成模块包含 32 层单流 DiT。由 Qwen3-VL 8B 负责读取提示词与输入图像。
- 单次编辑最多支持 10 张参考图。正如发布页所言:“在虚拟试衣场景下,可以将模特、衣服、鞋子、包包和帽子这五个输入元素组合成一套完整的穿搭。”
- 局部编辑。只需圈选区域、涂抹或传入单独的遮罩(mask),模型就能做到只改动指定区域。
- 极高的人像与商品还原度:这是其官方明确的训练目标。在编辑过程中,人脸特征保持不变,商品的“文字、纹理和形状”都能得到完美保留。
- 原生支持透明度。可以直接通过提示词输出 RGBA 图像,或者从照片中提取主体生成透明图层。
- 高效推理。输入图像和指令只需编码一次并在降噪步骤中缓存,因此,10 张参考图的单步编辑成本与单张参考图几乎相同。
在开发团队自研的 Qwen-Image-Bench 评测中,该模型得分为 60.28,在 29 款模型中位列第 7。排在前面的 6 款均为闭源模型(GPT Image 2.5 以 67.01 分领跑)。而在开源权重模型中,它以绝对优势稳居第一。

需要注意的是,这是官方公布的跑分,且仅针对生成能力而非编辑能力。目前,模型权重已上线 Hugging Face 和 ModelScope(魔搭社区),并在发布首日即刻支持 Diffusers、ComfyUI、vLLM-Omni 和 SGLang。
授权方面,该模型采用 Qwen Research License,规定“仅限非商业用途”。如需商用,需与阿里巴巴单独签署协议。详见下文。
它能用来做虚拟试衣吗?
完全可以,而且是零样本(zero-shot)直接上阵。
测试设置:我们选取了公开试衣案例库中的 8 组数据,每组包含一张对镜自拍图,以及一张商家通常会上传的商品图(平铺图或模特图)。Qwen-Image-2.1 在 Comfy Cloud 上运行(16 步);Vertex AI 则通过 API 调用。两者使用一致的提示词流程,不加任何 LoRA,也不做后处理。所有对比图从左至右依次为:买家实拍、商品图、Qwen-Image-2.1 效果、谷歌 Vertex AI 效果。
文章开头的足球服主要测试文本还原能力。两款模型都能清晰准确地保留赞助商标志和队徽的位置,且都没有改变买家的手部、手机和背景。

Qwen 表现更好的地方:在罩袍的商品图中,模特佩戴了一条奶油色头巾。Vertex 把头巾连同衣服一起“穿”到了买家身上,而 Qwen 则精准地只替换了罩袍。

Qwen 表现不佳的地方:风衣平铺图的长度到小腿中段。Vertex 准确还原了该长度,而 Qwen 的下摆却停在了膝盖。不过两者的腰带、门襟和翻领细节都很准确。在处理长款服装时,下摆长度是 Qwen 普遍存在的一个短板,这个问题在另一款分层连衣长裙的测试中也出现了。
至于另外 5 组测试(碎花中裙、荧光连帽衫、两件套纱丽、大码长裙和蕾丝婚纱),两者可谓平分秋色。它们都能完美还原纱丽的上衣和滚边,精准把控中裙的印花比例,并且都不会改变人物面部。
Qwen-Image-2.1 与 谷歌 Vertex AI 虚拟试衣对比
| Qwen-Image-2.1 (Comfy Cloud) | 谷歌 Vertex AI 虚拟试衣 | |
|---|---|---|
| 成功生成组数 | 8 组(共 8 组) | 8 组(共 8 组) |
| 单次试衣耗时中位数 | 9.9 秒 | 9.3 秒 |
| 单次试衣成本 | 约 $0.005 (GPU 算力耗时) | $0.06 (标价) |
| 视觉质量对比 | 6 组打平,1 组更优,1 组稍逊 | 6 组打平,1 组更优,1 组稍逊 |
| 模型权重 | 开源,支持微调 | 闭源 API |
| 授权协议 | 仅限研究,商用需授权 | 允许商用 |
需要说明的是,Qwen 的耗时包含了在 Comfy Cloud 上约 3 秒的排队时间。其成本仅计算了模型本身的 GPU 运行时间;而一次完整的试衣请求还包括服装分类、提示词构建以及质量检测等流程。
注意事项与局限
授权限制:Qwen-Image-2.1 采用的是 Qwen Research License 协议,有别于 Qwen-Image-Edit-2511 所用的 Apache 2.0。许可文件规定“仅限非商业用途”(即研究或评估),若要商用必须向阿里巴巴申请授权。在网店中添加试衣按钮显然属于商业行为。即便自行部署,也同样需要遵守此协议。
两个硬伤:一是长款衣物的下摆长度,二是处理多件套商品时偶尔会漏掉配件。这两个系统性问题正是 LoRA 的用武之地。在 7B 参数量下,单张显卡只需几个小时就能训好一个适配器(adapter)。ModelScope 上的 DiffSynth-Studio 发布首日即支持针对 2.1 版本的 LoRA 训练,ComfyUI 也能通过标准节点加载适配器。训练数据无非是模特上身图与商品平铺图的配对,而这正是服装画册现成的资源。实际上,只要在提示词中明确服装品类、门襟样式和长度,就能解决大部分下摆问题;剩下的边角问题交给 LoRA 即可。
对 Genlook 的意义
在我们的测试集中,Qwen-Image-2.1 成为首个能与商业级试衣 API 掰手腕的开源模型,而单张图像的成本却低得多。目前,我们正致力于升级 Genlook 的试衣引擎流水线,将 Qwen 部署在它擅长的领域。结合跨模型的服装分类、提示词构建与质量把控能力,确保每一类商品都能呈现最佳的试衣效果。上述提及的两个局限,正是我们流水线优化的首要目标。
对于开发者而言,Genlook Try-On API 提供了一个通吃所有商品品类的统一接口。1 个点数等于 1 次试衣:按量付费低至 $0.04,包月套餐更是低至 $0.015。套餐点数永久有效,新用户注册即赠免费点数。快速入门指南仅需四步即可跑通:创建商品、上传图片、生成、获取结果。
总结
- 本次发布:一个 7B 参数的开源权重模型,仅用单个权重便集成了图像生成、最多 10 张图的参考编辑以及透明度处理。在官方基准测试中排名开源模型榜首。
- 试衣表现:在 8 组零样本测试中,有 6 组与谷歌 Vertex AI 模型打成平手。在保留非衣物元素方面表现更佳,但在处理长衣下摆时稍显逊色。
- 成本分析:单图 GPU 耗时成本约为 $0.005,远低于对方的 $0.06。
- 注意事项:自行部署仅享有研究授权协议;模型存在的两个系统性缺陷需通过 LoRA 修复。
前往 platform.genlook.app 获取 API 密钥即可使用 Genlook 试衣 API,或者为你的店铺接入虚拟试衣功能。
常见问题