2026 年 9 月 20 日,阿里巴巴的 Qwen 團隊開源了 Qwen-Image-2.1。這是一個擁有 70 億參數(7B)的影像模型,能夠在單一流程中完成生成與編輯,最多可接受 10 張參考圖片,並明確將虛擬試穿列為目標應用場景。
我們使用了內部測試所有引擎時固定的八組人物與服裝組合,將它與目前市面上最主流的商業解決方案之一——Google 在 Vertex AI 上的虛擬試穿模型進行了並排測試。測試條件完全相同:一樣的照片、一樣的提示詞流程,且未經任何微調(fine-tuning)。

什麼是 Qwen-Image-2.1?
Qwen-Image-2.1 將過去三個模型(負責生成的 Qwen-Image、負責編輯的 Qwen-Image-Edit,以及負責透明背景的 Qwen-Image-Layered)的功能整合到一個 checkpoint 中。
- 7B 參數用於生成(32 層單流 DiT 架構)。由 Qwen3-VL 8B 負責讀取提示詞與輸入的圖片。
- 單次編輯最多支援 10 張參考圖片。根據發布頁面的說明:「在虛擬試穿應用中,可以結合五張輸入圖片(模特兒、衣服、鞋子、包包和帽子),直接生成一套完整的穿搭。」
- 局部編輯功能(Region editing)。無論是圈選區域、塗抹,或是提供獨立的遮罩,模型都只會改變該指定區域。
- 高度還原人物與商品是其訓練目標之一:編輯前後的人臉保持不變,商品的「文字、紋理和形狀」也能完整保留。
- 原生支援透明通道。可根據提示詞輸出 RGBA 圖片,或是從照片中將主體擷取為透明圖層。
- 高效率推論。輸入的圖片與指令只需編碼一次,並會在每個去噪(denoising)步驟中被快取下來。因此,使用十張參考圖片進行編輯的單步運算成本,與僅使用一張參考圖片差不多。
在團隊自建的 Qwen-Image-Bench 測試中,該模型獲得了 60.28 分,在 29 個模型中排名第七。排在它前面的六個都是閉源模型(GPT Image 2.5 以 67.01 分領先)。但在開源模型中,它以極大的優勢位居第一。

必須注意的是,這是一項由團隊自行報告的基準測試,且評測的是生成能力而非編輯能力。模型權重已發布在 Hugging Face 與 ModelScope,並且在發布首日即獲得 Diffusers、ComfyUI、vLLM-Omni 以及 SGLang 的支援。
授權方面,它採用了 Qwen Research License,僅限「非商業用途」。若需用於商業用途,必須與阿里巴巴另行簽署協議。更多細節請見下文。
拿來做虛擬試穿,效果好嗎?
答案是肯定的,即使是零樣本(zero-shot)測試,表現也很亮眼。
測試設定:我們從公開的試穿範例中挑選了八組圖片,每一組都包含一張對鏡自拍,以及一張商家常見的商品圖(平鋪白底圖或模特兒實穿圖)。Qwen-Image-2.1 在 Comfy Cloud 上執行,設定為 16 步;Vertex AI 則透過其 API 呼叫。兩者都使用相同的提示詞流程,沒有套用 LoRA,也沒有經過任何後製處理。以下各組圖片由左至右依序為:消費者照片、商品圖、Qwen-Image-2.1 結果、Google Vertex AI 結果。
文章開頭的足球衣圖片是一項測試文字保留能力的關卡。兩個模型都能清晰且正確地保留贊助商標誌與隊徽,同時也沒有改變消費者的手、手機或背景。

Qwen 表現較佳的地方。在這件罩袍的商品圖中,模特兒搭配了一條奶油色的圍巾。Vertex 將圍巾與服裝一起移植到了消費者身上;而 Qwen 則精準地只更換了罩袍,其餘保持原樣。

Qwen 表現較差的地方。商品圖中的風衣長度及於小腿中段。Vertex 正確保留了這個長度,但 Qwen 卻將長度縮短到膝蓋。雖然兩者在腰帶、排扣和翻領的處理上都很正確,但對於長版服飾的下擺長度掌握,是 Qwen 在這次測試中唯一一致的失誤,這個問題在另一件層次連身大洋裝的測試中也出現了。
至於另外五組測試(碎花中長裙、螢光連帽衫、兩件式紗麗、大尺碼長洋裝、蕾絲婚紗),我們很難分出高下。兩者都能正確處理紗麗的上衣與滾邊,也都能準確呈現中長裙的印花比例,且都沒有改變消費者的面貌。
Qwen-Image-2.1 與 Google Vertex AI 試穿模型大比拚
| Qwen-Image-2.1 (Comfy Cloud) | Google Vertex AI 虛擬試穿 | |
|---|---|---|
| 成功完成組數 | 8 / 8 | 8 / 8 |
| 單次試穿時間中位數 | 9.9 秒 | 9.3 秒 |
| 單次試穿成本 | 約 0.005 美元 (GPU 運算時間) | 0.06 美元 (定價) |
| 畫質並排比較 | 6 平手,1 勝,1 負 | 6 平手,1 勝,1 負 |
| 模型權重 | 開源,可微調 | 封閉 API |
| 授權限制 | 僅限研究,商業用途需簽約 | 商業可用 |
需要說明的是,Qwen 的時間包含了在 Comfy Cloud 上約三秒的排隊時間。而在成本方面,Qwen 的數字僅計算模型本身的 GPU 運算時間;一次完整的試穿請求還包含了服裝分類、提示詞建構以及品質檢查等步驟。
需要注意的門檻
授權問題。Qwen-Image-2.1 採用的是 Qwen Research License Agreement,而非 Qwen-Image-Edit-2511 所使用的 Apache 2.0 授權。授權條款明定僅限「非商業用途」(定義為研究或評估),商業用戶必須向阿里巴巴申請授權。在網路商店上放置「試穿」按鈕絕對屬於商業用途。即使是自行架設(self-hosting)也需要簽署該協議。
兩個明顯的失誤。長版服飾的下擺長度掌握不佳,以及在處理多配件商品時容易遺漏次要配件。這兩個問題都是系統性的,而這正是 LoRA 派上用場的時候。對於 7B 的模型,使用單張 GPU 訓練一個轉接器(adapter)只需要幾個小時。ModelScope 的 DiffSynth-Studio 從發布首日就支援 Qwen-Image-2.1 的 LoRA 訓練,ComfyUI 也能透過標準節點載入轉接器。訓練資料只需要模特兒實穿圖與對應的白底圖,這對許多服飾型錄來說都是現成的。其實,只要在提示詞中清楚寫出服裝類別、穿脫方式與長度,就能解決大部分的下擺問題;剩下的就可以交給 LoRA 來補足。
這對 Genlook 意味著什麼
Qwen-Image-2.1 是第一個在我們的測試圖組中,能夠與商業試穿 API 達到同等水準的開源模型,而且單張圖片的成本低了非常多。我們目前正在升級 Genlook 的試穿流程,準備在它擅長的環節導入這個模型。這個升級是建立在我們既有的服裝分類、提示詞建構與品質檢查機制之上的,為的就是確保每一種類型的商品,都能獲得當下最完美的試穿效果。上述提到的兩個失誤,正是我們優化流程的首要目標。
對於開發者來說,Genlook 試穿 API 是一個能處理所有商品類型的單一端點(endpoint)。一點額度就是一次試穿:隨用隨付方案單價 0.04 美元起,月費方案單價最低只要 0.015 美元。購買的額度方案永遠不會過期,新註冊的帳號還會獲得免費額度。我們的快速入門指南只要四個步驟:建立商品、上傳照片、生成、取得結果。
重點整理
- 最新發布: 一個 7B 的開源模型,在單一 checkpoint 中結合了生成、支援最多 10 張參考圖片的編輯,以及透明通道處理能力。在團隊的基準測試中是表現最好的開源模型。
- 試穿表現: 在零樣本測試中,8 組測試圖有 6 組與 Google 的 Vertex AI 模型打平。優點是能更精準地只改變服裝本身,缺點是在長版服飾的下擺長度掌握上略遜一籌。
- 成本比較: 每張圖片的 GPU 運算時間成本約 0.005 美元,相較於 Vertex AI 的 0.06 美元。
- 注意事項: 自行架設需注意其僅限研究的授權條款;模型在長度與配件上的一些失誤可透過訓練 LoRA 來解決。
前往 platform.genlook.app 取得 API 金鑰 開始使用 Genlook 試穿 API,或是為您的網店加入虛擬試穿功能。
常見問答