2026 年 9 月 20 日,阿里巴巴的 Qwen 團隊開源了 [Qwen-Image-2.1](https://qwen.ai/blog?id=qwen-image-2.1)。這是一個擁有 70 億參數(7B)的影像模型,能夠在單一流程中完成生成與編輯,最多可接受 10 張參考圖片,並明確將[虛擬試穿](/glossary/virtual-try-on)列為目標應用場景。

我們使用了內部測試所有引擎時固定的八組人物與服裝組合,將它與目前市面上最主流的商業解決方案之一——Google 在 Vertex AI 上的虛擬試穿模型進行了並排測試。測試條件完全相同:一樣的照片、一樣的提示詞流程,且未經任何微調(fine-tuning)。

![足球衣試穿。從左至右:消費者照片、商品白底圖、Qwen-Image-2.1 結果、Google Vertex AI 結果。](/blog-images/qwen-vs-vertex-tryon-marco-football-home-kit.webp)

## 什麼是 Qwen-Image-2.1?

Qwen-Image-2.1 將過去三個模型(負責生成的 Qwen-Image、負責編輯的 Qwen-Image-Edit,以及負責透明背景的 Qwen-Image-Layered)的功能整合到一個 checkpoint 中。

- **7B 參數**用於生成(32 層單流 DiT 架構)。由 Qwen3-VL 8B 負責讀取提示詞與輸入的圖片。
- **單次編輯最多支援 10 張參考圖片**。根據發布頁面的說明:「在虛擬試穿應用中,可以結合五張輸入圖片(模特兒、衣服、鞋子、包包和帽子),直接生成一套完整的穿搭。」
- **局部編輯功能(Region editing)**。無論是圈選區域、塗抹,或是提供獨立的遮罩,模型都只會改變該指定區域。
- **高度還原人物與商品**是其訓練目標之一:編輯前後的人臉保持不變,商品的「文字、紋理和形狀」也能完整保留。
- **原生支援透明通道**。可根據提示詞輸出 RGBA 圖片,或是從照片中將主體擷取為透明圖層。
- **高效率推論**。輸入的圖片與指令只需編碼一次,並會在每個去噪(denoising)步驟中被快取下來。因此,使用十張參考圖片進行編輯的單步運算成本,與僅使用一張參考圖片差不多。

在團隊自建的 Qwen-Image-Bench 測試中,該模型獲得了 60.28 分,在 29 個模型中排名第七。排在它前面的六個都是閉源模型(GPT Image 2.5 以 67.01 分領先)。但在開源模型中,它以極大的優勢位居第一。

![開源影像模型在 Qwen-Image-Bench 的分數與參數數量。Qwen-Image-2.1 以 7B 參數拿下 60.28 分領先群雄。](/blog-images/qwen-image-2-1-bench-open-weights.webp)

必須注意的是,這是一項由團隊自行報告的基準測試,且評測的是生成能力而非編輯能力。模型權重已發布在 Hugging Face 與 ModelScope,並且在發布首日即獲得 Diffusers、ComfyUI、vLLM-Omni 以及 SGLang 的支援。

授權方面,它採用了 **Qwen Research License**,僅限「非商業用途」。若需用於商業用途,必須與阿里巴巴另行簽署協議。更多細節請見下文。

## 拿來做虛擬試穿,效果好嗎?

答案是肯定的,即使是零樣本(zero-shot)測試,表現也很亮眼。

測試設定:我們從公開的試穿範例中挑選了八組圖片,每一組都包含一張對鏡自拍,以及一張商家常見的商品圖(平鋪白底圖或模特兒實穿圖)。Qwen-Image-2.1 在 Comfy Cloud 上執行,設定為 16 步;Vertex AI 則透過其 API 呼叫。兩者都使用相同的提示詞流程,沒有套用 LoRA,也沒有經過任何後製處理。以下各組圖片由左至右依序為:消費者照片、商品圖、Qwen-Image-2.1 結果、Google Vertex AI 結果。

文章開頭的足球衣圖片是一項測試文字保留能力的關卡。兩個模型都能清晰且正確地保留贊助商標誌與隊徽,同時也沒有改變消費者的手、手機或背景。

![罩袍試穿。從左至右:消費者照片、模特兒搭配奶油色圍巾的商品圖、Qwen-Image-2.1 僅更換罩袍的結果、Google Vertex AI 連同圍巾一起加上去的結果。](/blog-images/qwen-vs-vertex-tryon-amira-modest-black-abaya.webp)

**Qwen 表現較佳的地方**。在這件罩袍的商品圖中,模特兒搭配了一條奶油色的圍巾。Vertex 將圍巾與服裝一起移植到了消費者身上;而 Qwen 則精準地只更換了罩袍,其餘保持原樣。

![風衣試穿。從左至右:消費者照片、平鋪白底圖、Qwen-Image-2.1 長度只到膝蓋的結果、Google Vertex AI 保持小腿中段長度的結果。](/blog-images/qwen-vs-vertex-tryon-claire-trench-coat.webp)

**Qwen 表現較差的地方**。商品圖中的風衣長度及於小腿中段。Vertex 正確保留了這個長度,但 Qwen 卻將長度縮短到膝蓋。雖然兩者在腰帶、排扣和翻領的處理上都很正確,但對於長版服飾的下擺長度掌握,是 Qwen 在這次測試中唯一一致的失誤,這個問題在另一件層次連身大洋裝的測試中也出現了。

**至於另外五組測試**(碎花中長裙、螢光連帽衫、兩件式紗麗、大尺碼長洋裝、蕾絲婚紗),我們很難分出高下。兩者都能正確處理紗麗的上衣與滾邊,也都能準確呈現中長裙的印花比例,且都沒有改變消費者的面貌。

## Qwen-Image-2.1 與 Google Vertex AI 試穿模型大比拚

| | Qwen-Image-2.1 (Comfy Cloud) | Google Vertex AI 虛擬試穿 |
|---|---|---|
| 成功完成組數 | 8 / 8 | 8 / 8 |
| 單次試穿時間中位數 | 9.9 秒 | 9.3 秒 |
| 單次試穿成本 | 約 0.005 美元 (GPU 運算時間) | 0.06 美元 (定價) |
| 畫質並排比較 | 6 平手,1 勝,1 負 | 6 平手,1 勝,1 負 |
| 模型權重 | 開源,可微調 | 封閉 API |
| 授權限制 | 僅限研究,商業用途需簽約 | 商業可用 |

需要說明的是,Qwen 的時間包含了在 Comfy Cloud 上約三秒的排隊時間。而在成本方面,Qwen 的數字僅計算模型本身的 GPU 運算時間;一次完整的試穿請求還包含了服裝分類、提示詞建構以及品質檢查等步驟。

## 需要注意的門檻

**授權問題**。Qwen-Image-2.1 採用的是 Qwen Research License Agreement,而非 Qwen-Image-Edit-2511 所使用的 Apache 2.0 授權。授權條款明定僅限「非商業用途」(定義為研究或評估),商業用戶必須向阿里巴巴申請授權。在網路商店上放置「試穿」按鈕絕對屬於商業用途。即使是自行架設(self-hosting)也需要簽署該協議。

**兩個明顯的失誤**。長版服飾的下擺長度掌握不佳,以及在處理多配件商品時容易遺漏次要配件。這兩個問題都是系統性的,而這正是 LoRA 派上用場的時候。對於 7B 的模型,使用單張 GPU 訓練一個轉接器(adapter)只需要幾個小時。ModelScope 的 DiffSynth-Studio 從發布首日就支援 Qwen-Image-2.1 的 LoRA 訓練,ComfyUI 也能透過標準節點載入轉接器。訓練資料只需要模特兒實穿圖與對應的白底圖,這對許多服飾型錄來說都是現成的。其實,只要在提示詞中清楚寫出服裝類別、穿脫方式與長度,就能解決大部分的下擺問題;剩下的就可以交給 LoRA 來補足。

## 這對 Genlook 意味著什麼

Qwen-Image-2.1 是第一個在我們的測試圖組中,能夠與商業試穿 API 達到同等水準的開源模型,而且單張圖片的成本低了非常多。我們目前正在升級 Genlook 的試穿流程,準備在它擅長的環節導入這個模型。這個升級是建立在我們既有的服裝分類、提示詞建構與品質檢查機制之上的,為的就是確保每一種類型的商品,都能獲得當下最完美的試穿效果。上述提到的兩個失誤,正是我們優化流程的首要目標。

對於開發者來說,[Genlook 試穿 API](https://platform.genlook.app) 是一個能處理所有商品類型的單一端點(endpoint)。一點額度就是一次試穿:隨用隨付方案單價 0.04 美元起,月費方案單價最低只要 0.015 美元。購買的額度方案永遠不會過期,新註冊的帳號還會獲得免費額度。我們的[快速入門指南](/docs/tryon-api/quickstart)只要四個步驟:建立商品、上傳照片、生成、取得結果。

## 重點整理

- **最新發布:** 一個 7B 的開源模型,在單一 checkpoint 中結合了生成、支援最多 10 張參考圖片的編輯,以及透明通道處理能力。在團隊的基準測試中是表現最好的開源模型。
- **試穿表現:** 在零樣本測試中,8 組測試圖有 6 組與 Google 的 Vertex AI 模型打平。優點是能更精準地只改變服裝本身,缺點是在長版服飾的下擺長度掌握上略遜一籌。
- **成本比較:** 每張圖片的 GPU 運算時間成本約 0.005 美元,相較於 Vertex AI 的 0.06 美元。
- **注意事項:** 自行架設需注意其僅限研究的授權條款;模型在長度與配件上的一些失誤可透過訓練 LoRA 來解決。

---

_[前往 platform.genlook.app 取得 API 金鑰](https://platform.genlook.app) 開始使用 Genlook 試穿 API,或是[為您的網店加入虛擬試穿功能](/get-started)。_

<Faq>
  <FaqItem
    question="Qwen-Image-2.1 可以用來做虛擬試穿嗎?"
    answer="可以。在官方的發布說明中,就展示了用五張參考圖片(模特兒、衣服、鞋子、包包和帽子)組合出一整套穿搭的範例。在我們的八組基準測試中,它的零樣本表現有六組與 Google Vertex AI 試穿模型打平,一組勝出,一組落敗。"
  />
  <FaqItem
    question="Qwen-Image-2.1 可以免費免費用於商業用途嗎?"
    answer="不行。它採用的是 Qwen Research License Agreement,限制只能用於非商業的研究或評估,若需商業使用必須另外向阿里巴巴申請授權。相較之下,之前的 Qwen-Image-Edit-2511 是採用 Apache 2.0 授權。"
  />
  <FaqItem
    question="Qwen-Image-2.1 與 Google Vertex AI 虛擬試穿模型相比如何?"
    answer="在我們的測試中:單次試穿時間中位數為 9.9 秒對 9.3 秒,兩者都成功完成了 8 組測試;在畫質表現上,8 組中有 6 組平手;成本方面,Qwen 每張圖的 GPU 運算時間約 0.005 美元,而 Vertex 的定價是 0.06 美元。要注意的是,Vertex 是商業 API;Qwen 是在研究授權下的開源權重模型。"
  />
  <FaqItem
    question="可以使用 LoRA 微調 Qwen-Image-2.1 嗎?"
    answer="可以。ModelScope 上的 DiffSynth-Studio 支援 Qwen-Image-2.1 的 LoRA 訓練,ComfyUI 也能透過其標準的 LoRA 節點載入轉接器。在 7B 的參數規模下,使用單張 GPU 即可訓練轉接器。"
  />
  <FaqItem
    question="Genlook 試穿 API 的收費方式為何?"
    answer="一點額度等於一次試穿。隨用隨付的單價是 0.04 美元,月費方案最低可達單次 0.015 美元:入門方案 20 美元可試穿 1,000 次,擴展方案 300 美元可試穿 20,000 次。購買的額度方案永不過期,新帳號會獲得免費的初始額度。"
  />
</Faq>