Technology公開: September 21, 2026執筆: Thibault Mathian

Qwen-Image-2.1のバーチャル試着テスト結果

2026年9月20日にAlibabaがオープンソース化した「Qwen-Image-2.1」。Google Vertex AIのバーチャル試着モデルと8つのデータセットで比較検証し、精度やコスト、ライセンスの注意点をまとめました。

2026年9月20日、AlibabaのQwenチームは画像生成モデルQwen-Image-2.1をオープンソース化しました。生成と編集を単一のパイプラインで処理できる7B(70億)パラメータのモデルで、最大10枚の参照画像を処理でき、ターゲット用途の一つとしてバーチャル試着を挙げています。普段私たちがエンジン検証に用いている8組の「人物と服」のデータセットを使い、現在最も普及している商用オプションの一つであるGoogle Vertex AIのバーチャル試着モデルと比較テストを行いました。写真もプロンプトのパイプラインも完全に同一で、ファインチューニングは一切行っていません。

サッカージャージの試着。左から順に:購入者の写真、商品のパックショット、Qwen-Image-2.1の生成結果、Google Vertex AIの生成結果。
サッカージャージの試着。左から順に:購入者の写真、商品のパックショット、Qwen-Image-2.1の生成結果、Google Vertex AIの生成結果。
## Qwen-Image-2.1とは?Qwen-Image-2.1は、以前の3つのモデル(生成用のQwen-Image、編集用のQwen-Image-Edit、透過処理用のQwen-Image-Layered)を単一のチェックポイントに統合したものです。- 7Bパラメータの生成コンポーネント(32層のシングルストリームDiT層を採用)。プロンプトと入力画像の読み取りにはQwen3-VL 8Bを使用しています。- 1回の編集で最大10枚の参照画像に対応。 リリースノートには「バーチャル試着において、5つの入力(モデル、服、靴、バッグ、帽子)を組み合わせて全身のコーディネートを完成できる」と記載されています。- 領域指定の編集機能。 変更したい部分を丸で囲んだり、塗りつぶしたり、個別のマスクを指定することで、その領域のみを編集できます。- 人物と商品の忠実な再現をトレーニングの目標として明記。編集後も顔の特徴は維持され、商品の「テキスト、質感、形状」もしっかりと保たれます。- ネイティブな透過処理。 プロンプトからRGBA形式で直接出力したり、写真から被写体を切り抜いて透過レイヤーとして抽出することが可能です。- 効率的な推論。 入力画像と指示内容(インストラクション)を一度エンコードして全ノイズ除去ステップでキャッシュするため、10枚の画像を参照する編集でも、1枚のみの場合と1ステップあたりの計算コストはほぼ変わりません。開発チーム独自のベンチマーク「Qwen-Image-Bench」では、29モデル中7位となる60.28のスコアを記録しました。上位6モデルはすべてクローズドモデルであり(トップはGPT Image 2.5の67.01)、オープンウェイトのモデルの中では圧倒的な1位となっています。
オープンウェイト画像モデルのQwen-Image-Benchスコアとパラメータ数。Qwen-Image-2.1は7Bパラメータで60.28のスコアを記録しトップ。
オープンウェイト画像モデルのQwen-Image-Benchスコアとパラメータ数。Qwen-Image-2.1は7Bパラメータで60.28のスコアを記録しトップ。
ただし、これは自己申告のベンチマークであり、測定対象は「編集」ではなく「生成」能力です。モデルの重みはHugging FaceとModelScopeで公開されており、Diffusers、ComfyUI、vLLM-Omni、SGLangではリリース初日からサポートされています。ライセンスはQwen Research Licenseが適用され、「非商用目的のみ」に限定されています。商用利用にはAlibabaとの個別契約が必要です。詳細については後述します。## バーチャル試着に実用レベルで使えるか?結論から言うと、ゼロショット(事前学習なし)で十分に機能します。テスト環境: 一般公開している私たちの試着サンプルから8組を抽出。それぞれ「鏡越しの自撮り写真」と「マーチャントが実際にアップロードする商品画像(平置きのパックショットまたはモデル着用写真)」のペアです。Qwen-Image-2.1はComfy Cloud上で16ステップで実行。Vertex AIはAPI経由で実行しました。どちらも同じプロンプトパイプラインを通し、LoRAや後処理は一切行っていません。各画像は左から順に、購入者の写真、商品画像、Qwen-Image-2.1、Google Vertex AIの結果です。記事の冒頭にあるサッカージャージの画像は、文字認識のテストです。どちらのモデルもスポンサーのロゴやエンブレムの位置を正確に維持しており、購入者の手やスマートフォン、背景も変更されていません。
アバヤの試着。左から順に:購入者の写真、クリーム色のスカーフを着用したモデルの商品写真、アバヤのみを変更したQwen-Image-2.1の結果、スカーフまで追加してしまったGoogle Vertex AIの結果。
アバヤの試着。左から順に:購入者の写真、クリーム色のスカーフを着用したモデルの商品写真、アバヤのみを変更したQwen-Image-2.1の結果、スカーフまで追加してしまったGoogle Vertex AIの結果。
Qwenが優れていた点: 商品画像のアバヤ(中東の伝統的衣装)は、クリーム色のスカーフを巻いたモデルが着用しています。Vertex AIがスカーフごと着せ替えてしまったのに対し、Qwenはアバヤだけを的確に変更しました。
トレンチコートの試着。左から順に:購入者の写真、平置きのパックショット、膝丈で切れてしまったQwen-Image-2.1の結果、ふくらはぎの中間までの丈を維持したGoogle Vertex AIの結果。
トレンチコートの試着。左から順に:購入者の写真、平置きのパックショット、膝丈で切れてしまったQwen-Image-2.1の結果、ふくらはぎの中間までの丈を維持したGoogle Vertex AIの結果。
Qwenが劣っていた点: パックショットのコートはふくらはぎの中間までの長さ(ミモレ丈)です。Vertex AIはその長さを正確に維持しましたが、Qwenは膝丈で途切れてしまいました。ベルトやボタン、襟の形はどちらも正確に再現できています。丈の長い衣服における裾の位置は一貫してQwenの弱点となっており、ティアードマキシドレスのテストでも同じ問題が発生しました。その他の5組(花柄のミディ丈ワンピース、ネオンカラーのパーカー、ツーピースのサリー、プラスサイズのマキシ丈ドレス、レースのウェディングドレス)については、両者に優劣をつけるのは困難でした。どちらもサリーのブラウスと縁飾りを適切に処理し、ミディ丈ワンピースの柄の縮尺も正確で、顔立ちが変わってしまうこともありませんでした。## Qwen-Image-2.1 vs Google Vertex AI 比較表| | Comfy Cloud上のQwen-Image-2.1 | Google Vertex AI バーチャル試着 ||---|---|---|| 処理できたペア数 | 8/8 | 8/8 || 試着1回あたりの時間(中央値) | 9.9秒 | 9.3秒 || 試着1回あたりのコスト | 約0.005ドル(GPU実行時間) | 0.06ドル(定価) || 品質(横並び比較) | 6引き分け、1勝、1敗 | 6引き分け、1勝、1敗 || ウェイト | オープン(ファインチューニング可能) | クローズドAPI || ライセンス | 研究用途限定(商用は個別契約) | 商用利用可 |Qwenの処理時間には、Comfy Cloudでの約3秒の待機時間(キュー)が含まれています。また、Qwenのコストはモデル単体のGPU実行時間のみで計算しています。実際の試着リクエスト全体では、衣類の分類、プロンプトの構築、品質チェックのプロセスも実行されます。## 導入における注意点(ライセンスと技術的な課題)ライセンス制限: Qwen-Image-2.1は、Qwen-Image-Edit-2511のようなApache 2.0ではなく、「Qwen Research License Agreement」の下で提供されています。ライセンスファイルでは「非商用目的のみ(研究および評価)」と規定されており、商用利用の場合はAlibabaにライセンスを申請するよう求めています。ECサイトに「試着する」ボタンを設置する行為は商用利用に該当します。セルフホスティングする場合でもこの契約が必要です。2つの技術的課題: ロング丈の衣服における裾の長さの再現と、複数パーツからなる商品の一部(装飾など)が欠落してしまう問題です。どちらもシステムに起因するものであり、まさにLoRAで解決できる領域です。パラメータ数が7Bであるため、シングルGPUでも数時間でアダプターの学習が可能です。ModelScopeのDiffSynth-Studioはリリース初日から2.1のLoRA学習をサポートしており、ComfyUIも標準ノードでアダプターを読み込めます。学習データにはモデル着用写真とそれに対応するパックショットのペアを使用しますが、これはファッションカタログがすでに持っているデータです。服のカテゴリーや留め具、丈の長さを指定するプロンプトを工夫するだけで裾の欠落の大半は防げますし、残りの問題もLoRAで十分にカバーできます。## Genlookへの影響と今後の展望Qwen-Image-2.1は、私たちのデータセットにおいて商用試着APIと同等の品質に達した初のオープンモデルでありながら、1枚あたりのコストはごくわずかです。Genlookでは現在、すべてのプロダクトで最高の試着体験を提供できるよう試着パイプラインのアップグレードを進めており、どんなモデルの基盤にもある「衣類の分類、プロンプト構築、品質チェック」の上に、Qwenの強みが活きる部分を組み込んでいます。前述の2つの課題は、今回のパイプライン改修で最初に取り組むべき最優先事項です。開発者向けに提供しているGenlook Try-On APIは、あらゆる種類の商品を1つのエンドポイントで処理できる強力なAPIです。1クレジットで1回の試着が可能。従量課金制なら1回0.04ドル、月額プランなら1回あたり0.015ドルからご利用いただけます。買い切り(パック)クレジットに有効期限はなく、新規アカウントには無料クレジットが付与されます。クイックスタートガイドに沿って、商品の作成、写真のアップロード、生成、結果の取得というわずか4回のAPIコールで実装を完了できます。## まとめ- リリースの概要: 1つのチェックポイントで画像生成、最大10枚の参照画像を使った編集、透過処理までこなせる7Bのオープンウェイトモデル。開発チームのベンチマークにおいてオープンモデルの中で首位。- バーチャル試着の性能: ゼロショットでありながら、8組中6組でGoogle Vertex AIと同等の結果を達成。服以外の要素への干渉が少ない点は優れている一方、丈の長い衣服の裾処理に課題あり。- コスト: 1画像あたりのGPU実行コストは約0.005ドル(Vertex AIの定価は0.06ドル)。- 注意点: セルフホスト向けのライセンスは研究目的のみに制限。また、LoRAによるファインチューニングで解決すべき2つの技術的課題あり。---platform.genlook.appでAPIキーを取得してGenlook Try-On APIを利用するか、あなたのストアにバーチャル試着を導入しましょう。

FAQ

疑問にお答えします。

Qwen-Image-2.1はバーチャル試着に使えますか?↓
Qwen-Image-2.1は無料で商用利用できますか?↓
Qwen-Image-2.1とGoogle Vertex AIのバーチャル試着モデルはどう違いますか?↓
Qwen-Image-2.1をLoRAでファインチューニングすることは可能ですか?↓
Genlook Try-On APIの料金はいくらですか?↓

返品を削減し、コンバージョンを向上させる準備はできましたか?

数分でShopifyストアにGenlookをインストールできます。まずは無料プランから始めましょう。

関連記事