2026 年 9 月 20 日,阿里巴巴的 Qwen 團隊開源了 Qwen-Image-2.1。這是一個 7B 的圖像模型,將生成與編輯整合進單一流程中,最多支援 10 張參考圖片,並明確將虛擬試穿列為目標應用場景。
我們拿它與市面上最常見的商用選項之一——Google Vertex AI 上的虛擬試穿模型進行了比較,測試基準是我們所有引擎都會跑的 8 組人物與服裝配對。相同的照片、相同的提示詞(prompt)流程,完全沒有進行微調(fine-tuning)。

Qwen-Image-2.1 是什麼?
Qwen-Image-2.1 將三個舊版模型(負責生成的 Qwen-Image、負責編輯的 Qwen-Image-Edit、處理透明度的 Qwen-Image-Layered)整合進單一的檢查點(checkpoint)中。
- 生成組件有 7B 參數(32 層單流 DiT)。由 Qwen3-VL 8B 負責讀取提示詞與輸入的圖片。
- 單次編輯最多 10 張參考圖。官方發布頁面提到:「對於虛擬試穿,可以將 5 個輸入項目(模特兒、衣服、鞋子、包包和帽子)組合成一套完整的穿搭。」
- 局部編輯功能。圈出一個範圍、塗抹,或傳入獨立的遮罩(mask),模型只會針對該區域進行更改。
- 人與商品的高保真度 是明確的訓練目標:編輯後人臉保持不變,商品的「文字、紋理和形狀」也能完整保留。
- 原生支援透明度。可以直接從提示詞輸出 RGBA,也能從照片中將主體去背成透明圖層。
- 高效率推理。輸入的圖片與指令只會編碼一次,並在每個去噪步驟(denoising step)中被快取起來,因此帶有 10 張參考圖的編輯,單一步驟的計算成本與單張參考圖差不多。
在團隊自家的 Qwen-Image-Bench 測試中,它的得分為 60.28,在 29 個模型中排名第 7。排在它前面的 6 個都是閉源模型(GPT Image 2.5 以 67.01 領先)。但在開源權重(open-weight)模型中,它以大幅優勢穩居第一。

這是一份由官方自行公布的基準測試,而且測的是生成能力,而非編輯能力。模型權重已上架至 Hugging Face 與 ModelScope,並且發布首日就獲得 Diffusers、ComfyUI、vLLM-Omni 和 SGLang 的支援。
授權條款是 Qwen 研究授權(Qwen Research License),「僅限非商業用途」。商業使用需與阿里巴巴另簽協議。詳情請見後文。
拿來做虛擬試穿好用嗎?
答案是:好用,而且是零樣本(zero-shot)直出。
測試設定:從我們公開的試穿範例中挑選 8 組,每組都包含一張對鏡自拍照,加上商家會上傳的商品圖(平拍或模特兒實穿圖)。Qwen-Image-2.1 在 Comfy Cloud 上跑 16 步(steps)。Vertex AI 則是透過其 API 呼叫。兩者都使用相同的提示詞流程,沒有使用 LoRA,也沒有後製處理。以下每組圖片由左至右依序為:消費者照片、商品圖、Qwen-Image-2.1、Google Vertex AI。
文章開頭的足球衣是文字測試。兩個模型都成功讓贊助商字樣與隊徽保持清晰且位置正確,也沒有改變消費者的手、手機或背景。

Qwen 表現較好的地方。 這件罩袍的商品照中,模特兒配戴了一條奶油色的圍巾。Vertex 把圍巾連同衣服一起搬過去了,而 Qwen 則只替換了罩袍,其他都沒動。

Qwen 表現較差的地方。 平拍照裡的風衣長度大約到小腿肚。Vertex 保持了這個長度,但 Qwen 卻讓它停在膝蓋。不過,兩者的皮帶、排扣和翻領都做得很好。長版衣物的下襬長度是它唯一穩定出錯的地方,同樣的問題也出現在一件多層次的連身長裙上。
其餘 5 組(花卉中長裙、螢光連帽衫、兩件式紗麗、大尺碼長裙、蕾絲婚紗)則難分軒輊。兩者都保留了紗麗的上衣與花邊,都正確處理了中長裙的印花比例,而且都沒有改變人臉。
Qwen-Image-2.1 對決 Google Vertex AI 虛擬試穿
| Qwen-Image-2.1 在 Comfy Cloud | Google Vertex AI 虛擬試穿 | |
|---|---|---|
| 完成組數 | 8 / 8 | 8 / 8 |
| 試穿中位數時間 | 9.9 秒 | 9.3 秒 |
| 每次試穿成本 | 約 0.005 美元 (GPU 時間) | 0.06 美元 (牌價) |
| 畫質排排站 | 6 平手,1 勝,1 負 | 6 平手,1 勝,1 負 |
| 權重 | 開源,可微調 | 封閉 API |
| 授權 | 僅限研究,商用需協議 | 商用 |
Qwen 的時間包含了在 Comfy Cloud 上約 3 秒的排隊等待。Qwen 的成本純粹是模型運行的 GPU 時間;一個完整的試穿請求,其實還包含了服裝分類、建構提示詞與品質檢查等流程。
注意事項
授權。 Qwen-Image-2.1 採用的是 Qwen Research License Agreement,不像 Qwen-Image-Edit-2511 是採用 Apache 2.0。授權文件明訂「僅限非商業用途」,定義為研究或評估,並指引商業用戶需向阿里巴巴申請授權。在網店上放一個試穿按鈕就是商業用途。自行架設(Self-hosting)也需要取得該協議。
兩個失誤點。 長版衣物的下襬長度,以及在多部件商品中遺漏次要配件。這兩個都是系統性的問題,而這正是 LoRA 派上用場的時候。在 7B 參數下,單張 GPU 花幾個小時就能訓練好一個適配器(adapter)。ModelScope 的 DiffSynth-Studio 從發布首日就支援 2.1 的 LoRA 訓練,而 ComfyUI 也可以透過標準的節點載入適配器。訓練資料就是將模特兒實穿圖與對應的平拍照配對起來,這對服飾型錄來說是現成的資源。在提示詞中指明服裝種類、開襟方式與長度,就能自行修正大部分的下襬問題;剩下的就交給 LoRA 處理。
這對 Genlook 意味著什麼
Qwen-Image-2.1 是第一個在我們的測試樣本上,表現能與商用試穿 API 媲美的開源模型,而且單張圖片的成本低廉許多。我們正在升級 Genlook 的試穿管線,在它表現較強的領域採用它,並將其建構在服裝分類、提示詞生成與品管檢查等通用模組之上,確保每種商品類型都能獲得最佳的試穿品質。前述的兩個失誤點,正是我們管線升級的首要目標。
對於開發者來說,Genlook 試穿 API 是一個能處理所有商品類型的單一端點。一點額度就是一次試穿,每點只要 0.01 美元。沒有平台費、不用買席位、沒有每月最低消費,額度永不過期,新帳號註冊還送免費額度。快速入門指南只要 4 個呼叫步驟:建立商品、上傳照片、生成,最後取得結果。
總結
- 本次發布: 7B 開源權重模型,單一檢查點包辦生成、最多 10 張參考圖編輯與透明度處理。是官方基準測試中表現最好的開源模型。
- 試穿表現: 在 8 組樣本中,以零樣本直出與 Google Vertex AI 打成 6 平。較懂得不去動服裝以外的物件,但在長版衣物的下襬長度處理上較弱。
- 成本: 單圖 GPU 運算成本約 0.005 美元,對比商用的 0.06 美元。
- 要注意的是: 自架用戶需面對僅限研究的授權條款,以及兩個靠 LoRA 就能解決的系統性小失誤。
前往 platform.genlook.app 取得 API 金鑰 以使用 Genlook 試穿 API,或是為您的網店加入虛擬試穿功能。
常見問答