2026 年 9 月 20 日,阿里巴巴的 Qwen 團隊開源了 [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1)。這是一個 7B 的圖像模型,將生成與編輯整合進單一流程中,最多支援 10 張參考圖片,並明確將[虛擬試穿](/glossary/virtual-try-on)列為目標應用場景。

我們拿它與市面上最常見的商用選項之一——Google Vertex AI 上的虛擬試穿模型進行了比較,測試基準是我們所有引擎都會跑的 8 組人物與服裝配對。相同的照片、相同的提示詞(prompt)流程,完全沒有進行微調(fine-tuning)。

![足球衣試穿。從左至右:消費者照片、商品平拍照、Qwen-Image-2.1 結果、Google Vertex AI 結果。](/blog-images/qwen-vs-vertex-tryon-marco-football-home-kit.webp)

## Qwen-Image-2.1 是什麼?

Qwen-Image-2.1 將三個舊版模型(負責生成的 Qwen-Image、負責編輯的 Qwen-Image-Edit、處理透明度的 Qwen-Image-Layered)整合進單一的檢查點(checkpoint)中。

- **生成組件有 7B 參數**(32 層單流 DiT)。由 Qwen3-VL 8B 負責讀取提示詞與輸入的圖片。
- **單次編輯最多 10 張參考圖**。官方發布頁面提到:「對於虛擬試穿,可以將 5 個輸入項目(模特兒、衣服、鞋子、包包和帽子)組合成一套完整的穿搭。」
- **局部編輯功能**。圈出一個範圍、塗抹,或傳入獨立的遮罩(mask),模型只會針對該區域進行更改。
- **人與商品的高保真度** 是明確的訓練目標:編輯後人臉保持不變,商品的「文字、紋理和形狀」也能完整保留。
- **原生支援透明度**。可以直接從提示詞輸出 RGBA,也能從照片中將主體去背成透明圖層。
- **高效率推理**。輸入的圖片與指令只會編碼一次,並在每個去噪步驟(denoising step)中被快取起來,因此帶有 10 張參考圖的編輯,單一步驟的計算成本與單張參考圖差不多。

在團隊自家的 Qwen-Image-Bench 測試中,它的得分為 60.28,在 29 個模型中排名第 7。排在它前面的 6 個都是閉源模型(GPT Image 2.5 以 67.01 領先)。但在開源權重(open-weight)模型中,它以大幅優勢穩居第一。

![開源權重圖像模型的 Qwen-Image-Bench 得分與參數數量比較。Qwen-Image-2.1 以 7B 參數、60.28 分領先群雄。](/blog-images/qwen-image-2-1-bench-open-weights.webp)

這是一份由官方自行公布的基準測試,而且測的是生成能力,而非編輯能力。模型權重已上架至 Hugging Face 與 ModelScope,並且發布首日就獲得 Diffusers、ComfyUI、vLLM-Omni 和 SGLang 的支援。

授權條款是 **Qwen 研究授權(Qwen Research License)**,「僅限非商業用途」。商業使用需與阿里巴巴另簽協議。詳情請見後文。

## 拿來做虛擬試穿好用嗎?

答案是:好用,而且是零樣本(zero-shot)直出。

測試設定:從我們公開的試穿範例中挑選 8 組,每組都包含一張對鏡自拍照,加上商家會上傳的商品圖(平拍或模特兒實穿圖)。Qwen-Image-2.1 在 Comfy Cloud 上跑 16 步(steps)。Vertex AI 則是透過其 API 呼叫。兩者都使用相同的提示詞流程,沒有使用 LoRA,也沒有後製處理。以下每組圖片由左至右依序為:消費者照片、商品圖、Qwen-Image-2.1、Google Vertex AI。

文章開頭的足球衣是文字測試。兩個模型都成功讓贊助商字樣與隊徽保持清晰且位置正確,也沒有改變消費者的手、手機或背景。

![罩袍(Abaya)試穿。從左至右:消費者照片、模特兒配戴奶油色圍巾的商品實穿圖、Qwen-Image-2.1 只替換罩袍的結果、Google Vertex AI 連圍巾也一起加進去的結果。](/blog-images/qwen-vs-vertex-tryon-amira-modest-black-abaya.webp)

**Qwen 表現較好的地方。** 這件罩袍的商品照中,模特兒配戴了一條奶油色的圍巾。Vertex 把圍巾連同衣服一起搬過去了,而 Qwen 則只替換了罩袍,其他都沒動。

![風衣試穿。從左至右:消費者照片、商品平拍照、Qwen-Image-2.1 衣服長度只到膝蓋的結果、Google Vertex AI 保持小腿中段長度的結果。](/blog-images/qwen-vs-vertex-tryon-claire-trench-coat.webp)

**Qwen 表現較差的地方。** 平拍照裡的風衣長度大約到小腿肚。Vertex 保持了這個長度,但 Qwen 卻讓它停在膝蓋。不過,兩者的皮帶、排扣和翻領都做得很好。長版衣物的下襬長度是它唯一穩定出錯的地方,同樣的問題也出現在一件多層次的連身長裙上。

**其餘 5 組**(花卉中長裙、螢光連帽衫、兩件式紗麗、大尺碼長裙、蕾絲婚紗)則難分軒輊。兩者都保留了紗麗的上衣與花邊,都正確處理了中長裙的印花比例,而且都沒有改變人臉。

## Qwen-Image-2.1 對決 Google Vertex AI 虛擬試穿

| | Qwen-Image-2.1 在 Comfy Cloud | Google Vertex AI 虛擬試穿 |
|---|---|---|
| 完成組數 | 8 / 8 | 8 / 8 |
| 試穿中位數時間 | 9.9 秒 | 9.3 秒 |
| 每次試穿成本 | 約 0.005 美元 (GPU 時間) | 0.06 美元 (牌價) |
| 畫質排排站 | 6 平手,1 勝,1 負 | 6 平手,1 勝,1 負 |
| 權重 | 開源,可微調 | 封閉 API |
| 授權 | 僅限研究,商用需協議 | 商用 |

Qwen 的時間包含了在 Comfy Cloud 上約 3 秒的排隊等待。Qwen 的成本純粹是模型運行的 GPU 時間;一個完整的試穿請求,其實還包含了服裝分類、建構提示詞與品質檢查等流程。

## 注意事項

**授權。** Qwen-Image-2.1 採用的是 Qwen Research License Agreement,不像 Qwen-Image-Edit-2511 是採用 Apache 2.0。授權文件明訂「僅限非商業用途」,定義為研究或評估,並指引商業用戶需向阿里巴巴申請授權。在網店上放一個試穿按鈕就是商業用途。自行架設(Self-hosting)也需要取得該協議。

**兩個失誤點。** 長版衣物的下襬長度,以及在多部件商品中遺漏次要配件。這兩個都是系統性的問題,而這正是 LoRA 派上用場的時候。在 7B 參數下,單張 GPU 花幾個小時就能訓練好一個適配器(adapter)。ModelScope 的 DiffSynth-Studio 從發布首日就支援 2.1 的 LoRA 訓練,而 ComfyUI 也可以透過標準的節點載入適配器。訓練資料就是將模特兒實穿圖與對應的平拍照配對起來,這對服飾型錄來說是現成的資源。在提示詞中指明服裝種類、開襟方式與長度,就能自行修正大部分的下襬問題;剩下的就交給 LoRA 處理。

## 這對 Genlook 意味著什麼

Qwen-Image-2.1 是第一個在我們的測試樣本上,表現能與商用試穿 API 媲美的開源模型,而且單張圖片的成本低廉許多。我們正在升級 Genlook 的試穿管線,在它表現較強的領域採用它,並將其建構在服裝分類、提示詞生成與品管檢查等通用模組之上,確保每種商品類型都能獲得最佳的試穿品質。前述的兩個失誤點,正是我們管線升級的首要目標。

對於開發者來說,[Genlook 試穿 API](https://platform.genlook.app) 是一個能處理所有商品類型的單一端點。一點額度就是一次試穿,每點只要 0.01 美元。沒有平台費、不用買席位、沒有每月最低消費,額度永不過期,新帳號註冊還送免費額度。[快速入門指南](/docs/tryon-api/quickstart)只要 4 個呼叫步驟:建立商品、上傳照片、生成,最後取得結果。

## 總結

- **本次發布:** 7B 開源權重模型,單一檢查點包辦生成、最多 10 張參考圖編輯與透明度處理。是官方基準測試中表現最好的開源模型。
- **試穿表現:** 在 8 組樣本中,以零樣本直出與 Google Vertex AI 打成 6 平。較懂得不去動服裝以外的物件,但在長版衣物的下襬長度處理上較弱。
- **成本:** 單圖 GPU 運算成本約 0.005 美元,對比商用的 0.06 美元。
- **要注意的是:** 自架用戶需面對僅限研究的授權條款,以及兩個靠 LoRA 就能解決的系統性小失誤。

---

_前往 [platform.genlook.app 取得 API 金鑰](https://platform.genlook.app) 以使用 Genlook 試穿 API,或是[為您的網店加入虛擬試穿功能](/get-started)。_

<Faq>
  <FaqItem
    question="Qwen-Image-2.1 可以用來做虛擬試穿嗎?"
    answer="可以。官方發布中展示了用 5 張參考圖片(模特兒、衣服、鞋子、包包和帽子)組合成一套穿搭的能力。在我們的 8 組基準測試中,它的零樣本表現與 Google Vertex AI 試穿模型打了 6 個平手,並取得 1 勝 1 負的成績。"
  />
  <FaqItem
    question="Qwen-Image-2.1 可以免費商用嗎?"
    answer="不行。它採用 Qwen Research License Agreement 發布,僅限於非商業的研究或評估用途,商業使用需另外向阿里巴巴取得授權。相較之下,Qwen-Image-Edit-2511 採用的是 Apache 2.0。"
  />
  <FaqItem
    question="Qwen-Image-2.1 與 Google Vertex AI 虛擬試穿模型相比如何?"
    answer="在我們的測試中:中位數時間 9.9 秒對 9.3 秒,8 組全數完成,畫質上 8 組有 6 組平手。成本方面,Qwen 單圖的 GPU 時間約 0.005 美元,而 Vertex 的牌價是 0.06 美元。Vertex 是商業 API;Qwen 則是研究授權下的開源權重模型。"
  />
  <FaqItem
    question="可以使用 LoRA 微調 Qwen-Image-2.1 嗎?"
    answer="可以。ModelScope 上的 DiffSynth-Studio 支援 Qwen-Image-2.1 的 LoRA 訓練,ComfyUI 也能透過標準的 LoRA 節點載入適配器。在 7B 參數下,單張 GPU 就能訓練適配器。"
  />
  <FaqItem
    question="Genlook 試穿 API 的費用怎麼算?"
    answer="一點額度等於一次試穿,每點 0.01 美元。免平台費、免綁席位、無每月低消。額度永不過期,新帳號還附贈免費額度。"
  />
</Faq>