Technology公開: September 21, 2026執筆: Thibault Mathian

バーチャル試着向けQwen-Image-2.1:テスト結果

アリババが2026年9月20日にQwen-Image-2.1をオープンソース化。GoogleのVertex AIモデルと並べて8つの試着ペアでテストを実施し、結果、コスト、ライセンスの注意点をまとめました。

目次

2026年9月20日、アリババのQwenチームはQwen-Image-2.1をオープンソースとして公開しました。これは、生成と編集を単一のパイプラインで処理する7Bの画像モデルです。最大10枚の参照画像を扱うことができ、想定ユースケースとしてバーチャル試着を挙げています。

私たちは、すべてのエンジンで用いる8つの「人物と衣服」のペアを使い、この新モデルをテストしました。比較対象は、現在最も普及している商用オプションのひとつ、Google Vertex AIのバーチャル試着モデルです。写真は同じものを使用し、プロンプトパイプラインも統一。ファインチューニングは一切行っていません。

サッカーシャツの試着。左から:購入者の写真、商品画像、Qwen-Image-2.1の結果、Google Vertex AIの結果。
サッカーシャツの試着。左から:購入者の写真、商品画像、Qwen-Image-2.1の結果、Google Vertex AIの結果。

Qwen-Image-2.1とは?

Qwen-Image-2.1は、3つの旧モデル(生成用のQwen-Image、編集用のQwen-Image-Edit、透過処理用のQwen-Image-Layered)を単一のチェックポイントに統合したものです。

  • 7Bパラメータの生成コンポーネント(32層のシングルストリームDiT)。Qwen3-VL 8Bがプロンプトと入力画像を読み取ります。
  • 1回の編集で最大10枚の参照画像に対応。リリースページによれば、「バーチャル試着において、5つの入力(モデル、服、靴、バッグ、帽子)を組み合わせて完全なコーディネートを作成できる」とされています。
  • **部分的な編集。**範囲を囲んで塗りつぶすか、別個のマスクを渡すだけで、その領域だけを変更できます。
  • 人物と商品の忠実度がトレーニングの目標として掲げられています。編集後も顔は変わらず、商品の「文字、質感、形状」も保たれます。
  • **ネイティブな透過処理。**プロンプトからRGBA出力を行ったり、写真から被写体を切り抜いて透明なレイヤーとして出力したりできます。
  • **効率的な推論。**入力画像と指示は一度エンコードされた後、すべてのノイズ除去ステップでキャッシュされるため、10枚の参照画像を使った編集でも、1ステップあたりのコストは参照画像1枚の場合とほぼ同じです。

同チーム独自のベンチマーク「Qwen-Image-Bench」ではスコア60.28を記録し、29モデル中7位となりました。上位6つはクローズドモデル(GPT Image 2.5が67.01でトップ)ですが、オープンウェイトモデルの中では圧倒的な1位です。

オープンウェイト画像モデルのQwen-Image-Benchスコアとパラメータ数。Qwen-Image-2.1は7Bパラメータで60.28を記録しトップ。
オープンウェイト画像モデルのQwen-Image-Benchスコアとパラメータ数。Qwen-Image-2.1は7Bパラメータで60.28を記録しトップ。

これは自己申告のベンチマークであり、編集ではなく生成の性能を測定したものです。ウェイトはHugging FaceとModelScopeで公開されており、Diffusers、ComfyUI、vLLM-Omni、SGLangでリリース初日からサポートされています。

ライセンスはQwen Research Licenseで、「非商用目的での利用のみ」に限定されています。商用利用にはアリババとの個別契約が必要です。詳細は後述します。

バーチャル試着に使えるのか?

はい、ゼロショットで十分使えます。

設定:公開中の試着例から8つのペアを用意しました。それぞれ、鏡越しの自撮り写真と、マーチャントがアップロードするであろう商品画像(平置きまたはモデル着用)の組み合わせです。Qwen-Image-2.1はComfy Cloud上で16ステップで実行。Vertex AIはAPI経由で実行しました。どちらも同じプロンプトパイプラインを通し、LoRAや後処理は一切行っていません。各パネルは左から右へ、購入者の写真、商品画像、Qwen-Image-2.1、Google Vertex AIの順に並んでいます。

記事冒頭のサッカーシャツはテキストのテストです。どちらのモデルもスポンサーのロゴやエンブレムの視認性と位置を維持しており、購入者の手やスマートフォン、背景を変えることもありませんでした。

アバヤの試着。左から:購入者の写真、クリーム色のスカーフをまとったモデル着用商品画像、アバヤのみを変更したQwen-Image-2.1の結果、スカーフも追加してしまったGoogle Vertex AIの結果。
アバヤの試着。左から:購入者の写真、クリーム色のスカーフをまとったモデル着用商品画像、アバヤのみを変更したQwen-Image-2.1の結果、スカーフも追加してしまったGoogle Vertex AIの結果。

**Qwenが優れていた点。**アバヤはクリーム色のスカーフを巻いたモデルで撮影されていました。Vertexは衣服と一緒にスカーフまで引き継いでしまいましたが、Qwenはアバヤだけを変更し、他の要素はそのまま残しました。

トレンチコートの試着。左から:購入者の写真、平置きの商品画像、膝丈で止まってしまったQwen-Image-2.1の結果、ふくらはぎの長さを維持したGoogle Vertex AIの結果。
トレンチコートの試着。左から:購入者の写真、平置きの商品画像、膝丈で止まってしまったQwen-Image-2.1の結果、ふくらはぎの長さを維持したGoogle Vertex AIの結果。

**Qwenが劣っていた点。**商品画像のコートはふくらはぎまでの長さです。Vertexはその長さを保ちましたが、Qwenは膝丈で止まってしまいました。ベルト、ボタン、襟元はどちらも正確でした。丈の長い衣服における裾の長さの再現は全体的に不安定で、段になったマキシドレスでも同じ問題が発生しました。

その他の5ペア(花柄のミディ丈、ネオンカラーのパーカー、2ピースのサリー、プラスサイズのマキシ丈、レースのウェディングドレス)については、優劣をつけるのが困難でした。どちらのモデルもサリーのブラウスと縁取りを正確に引き継ぎ、ミディ丈のプリントの縮尺も完璧で、顔の改変もありませんでした。

Qwen-Image-2.1 vs Google Vertex AI 試着

Comfy CloudでのQwen-Image-2.1Google Vertex AI バーチャル試着
処理完了ペア数8件中8件8件中8件
試着ごとの処理時間(中央値)9.9秒9.3秒
試着ごとのコスト約0.005ドル(GPU時間)0.06ドル(定価)
品質比較6件引き分け、1件優位、1件劣位6件引き分け、1件優位、1件劣位
ウェイトオープン、ファインチューニング可能クローズドAPI
ライセンス研究目的のみ、商用利用は要契約商用利用可

Qwenの処理時間には、Comfy Cloudでの約3秒のキュー待ち時間が含まれています。Qwenのコストはモデル単体のGPU時間のみを計算したものです。実際の試着リクエストでは、これに加えて衣服の分類、プロンプトの構築、品質チェックの処理が発生します。

注意点

**ライセンス。**Qwen-Image-2.1は、Qwen-Image-Edit-2511のようなApache 2.0ではなく、Qwen Research License Agreementの下で提供されています。ライセンスファイルには「非商用目的のみ」での利用が許可されると明記されており、研究や評価を指します。商用利用の場合はアリババにライセンスを申請するよう求めています。ストアへの「試着する」ボタンの設置は商用利用に該当します。セルフホスティングを行う場合でも、この契約が必要です。

**2つの弱点。**丈の長い衣服における裾の長さの不正確さと、複数パーツで構成される商品における一部パーツの欠落です。どちらもシステム上の問題であり、まさにLoRAで解決すべき課題です。7Bのパラメータ数であれば、アダプターは単一のGPUを使って数時間でトレーニングできます。ModelScopeのDiffSynth-Studioは初日からQwen-Image-2.1のLoRAトレーニングをサポートしており、ComfyUIも標準ノードでアダプターを読み込めます。トレーニングデータには、モデル着用写真とそれに対応する商品画像のペアを使用しますが、ファッションカタログにはすでにこうしたデータが揃っています。衣服のカテゴリ、留め具、長さを指定するプロンプトを工夫するだけで、裾の問題の大部分は解決できますし、残りはLoRAでカバーできます。

Genlookへの影響

Qwen-Image-2.1は、私たちのテストペアにおいて商用試着APIと同等の性能を達成した初のオープンモデルでありながら、画像あたりのコストはその数分の一に抑えられています。現在、Genlookの試着パイプラインをアップグレードし、このモデルが得意とする領域で活用できるように進めています。モデルの周囲に配置された衣服の分類、プロンプト構築、品質チェック機能と組み合わせることで、あらゆる種類の商品で最高品質の試着体験を提供できるようにします。前述した2つの弱点は、今回のパイプライン改修で最初に取り組むべきターゲットです。

開発者向けには、Genlook Try-On APIを提供しています。これはあらゆる商品タイプに対応する単一のエンドポイントです。1回の試着で1クレジットを消費し、1クレジットは0.01ドルです。プラットフォーム利用料、シート料金、月額最低料金は一切かかりません。クレジットに有効期限はなく、新規アカウントには無料クレジットが付与されます。クイックスタートでは、商品の作成、写真のアップロード、生成、結果の取得という4つのコールだけで完了します。

まとめ

  • **今回のリリース:**生成、最大10件の参照画像を用いた編集、透過処理を単一のチェックポイントで処理できる7Bのオープンウェイトモデル。開発チームのベンチマークにおいて、オープンモデルの中でトップの成績。
  • **試着性能:**8ペア中6ペアでGoogle Vertex AIモデルと互角のゼロショット性能。衣服以外の要素をそのまま残す点では優れているが、丈の長い衣服の裾の長さでは劣る。
  • **コスト:**画像1枚あたり、GPU時間で約0.005ドル対0.06ドル。
  • **注意点:**セルフホストには研究用途限定のライセンスが適用されること。そして、LoRAで修正可能な2つの弱点があること。

Genlook Try-On APIを利用するにはplatform.genlook.appでAPIキーを取得してください。またはストアにバーチャル試着機能を追加することもできます。

FAQ

疑問にお答えします。

Qwen-Image-2.1でバーチャル試着はできますか?
Qwen-Image-2.1は商用利用無料ですか?
Qwen-Image-2.1とGoogle Vertex AIのバーチャル試着を比較するとどうなりますか?
Qwen-Image-2.1をLoRAでファインチューニングすることはできますか?
Genlook Try-On APIの料金はいくらですか?

返品を削減し、コンバージョンを向上させる準備はできましたか?

数分でShopifyストアにGenlookをインストールできます。まずは無料プランから始めましょう。

関連記事