【Qwen-Image-2.1】7Bで透過画像も生成できるAlibabaの最新画像生成AIの使い方・性能を徹底解説

Qwen-Image-2.1 7B 透過画像 生成 Alibaba 最新 画像生成AI 使い方 性能 徹底 解説
押さえておきたいポイント
  • Qwen-Image-2.1は、Alibabaが2026年9月20日にオープンウェイト公開した画像生成・編集の統合AIモデル
  • 視覚生成部分はわずか7Bパラメータながら、多くのクローズドソースモデルを上回る品質を達成
  • 透過画像(RGBA)のネイティブ生成・編集に対応し、最大10枚の参照画像を一度に処理できる

2026年9月20日、Alibabaの生成AIチーム「Qwen」が、画像生成AI「Qwen-Image-2.1」をオープンウェイトとして公開しました!

Qwen-Imageシリーズの最新モデルとなるこのモデルは、画像の「生成」と「編集」を1つのアーキテクチャに統合したことが最大の注目ポイントです。視覚生成コンポーネントのパラメータ数はわずか7Bに抑えられているにもかかわらず、多くのクローズドソースモデルを上回る性能を実現しています。

【Qwen-Image-2.1】7Bで透過画像も生成できるAlibabaの最新画像生成AIの使い方・性能を徹底解説

「でも、どうやって使うの?」「ライセンスはどうなっている?」と気になっている方も多いのではないでしょうか。そこでこの記事では、Qwen-Image-2.1の概要から仕組み、性能、料金、使い方、活用シーンまでを徹底解説します。ぜひ最後までご覧ください!

\生成AIを活用して業務プロセスを自動化/

tamura

監修者田村 洋樹

株式会社WEEL代表取締役 / 累計25社以上のAIアドバイザリーを担当 / 企業向けセミナー・大学講義でのべ10,000人超に登壇 / 日本HP・インテルなど、大手企業主催カンファレンスへの登壇実績多数。AI導入支援・生成AIを活用した業務改革のプロとして、アドバイザリー・PM・講演者など多面的な立場から企業を支援中。

目次

Qwen-Image-2.1とは?

Qwen-Image-2.1とは?
参考:https://qwen.ai/blog?id=qwen-image-2.1

Qwen-Image-2.1は、Alibaba(アリババ)のAI研究チーム「Qwen」が開発した画像生成・画像編集を統合的に行える次世代のオープンウェイトモデルです。

前身モデルであるQwen-Image(2025年8月公開、20Bパラメータ)から大幅にアーキテクチャが刷新されていて、視覚生成コンポーネントのパラメータ数を7Bまで圧縮しつつ品質を向上させた点が特徴的です。テキストエンコーダ部分を含めた総パラメータ数は約16.22B(ModelScope表記)で、ファイルサイズは合計約33GBとなっています。

Qwen-Image-2.1とは?
参考:https://qwen.ai/blog?id=qwen-image-2.1

このモデルがユニークなのは、「テキストから画像を生成する」機能と「既存の画像を編集する」機能を1つのチェックポイントで切り替えなしに実行できる点です。従来の画像生成AIでは、生成と編集は別々のモデルとして提供されることが一般的でしたが、Qwen-Image-2.1では統合パイプラインにより、1つのモデルでシームレスに両方のタスクをこなせます。

さらに、透過画像(RGBAレイヤー)をネイティブで生成・編集できるようになった点も大きな進化です。ステッカーやロゴの制作、合成素材の作成など、デザイン業務で求められる透過背景の画像を、後処理なしでそのまま出力できます。

Qwen-Image-2.1の仕組み

Qwen-Image-2.1の仕組み

Qwen-Image-2.1は、テキストエンコーダとDiffusion Transformerの2つのコンポーネントを統合したシングルストリーム型アーキテクチャを採用しています。

具体的には、まずテキストエンコーダにQwen3-VL 8B(ビジョン・ランゲージモデル)が搭載されていて、テキストの指示文と条件画像(参照画像)を統一的な表現に変換します。続いて、視覚生成部となる7B・32層のSingle-Stream DiT(Diffusion Transformer)が、そのエンコード結果を受け取って画像のデノイジングを行い、最終的な画像を生成する流れです。

Attention機構にはBlock-Causalアテンションと呼ばれる混合粒度の仕組みが採用されていて、テキストトークンにはトークンレベルの因果的マスクを、画像にはチャンクレベルの双方向マスクを適用します。この設計によって、テキストと画像それぞれに最適な粒度で情報を処理できるようになっています。

また、VAE(変分オートエンコーダ)部分には64チャネルRGBAオートエンコーダが組み込まれていて、空間方向を16倍に圧縮しつつ透過情報をネイティブに扱えます。スケジューラにはFlow MatchingとEuler離散スケジューリングを採用していて、動的シフトによる効率的な推論を実現しています。

Qwen-Image-2.1の特徴

Qwen-Image-2.1の性能面で注目すべきポイントが複数あります。

Qwen-Image-2.1の特徴
参考:https://qwen.ai/blog?id=qwen-image-2.1

まず性能面では、Qwen-Image-BenchにおいてQwen-Image-2.1はスコア60.28を記録しています。

これは、パラメータ数32BのFLUX 2 Max(55.33)や、GPT Image 1(54.07)を上回る結果です。首位のGPT Image 2.5 Sunburst(67.01)には届かないものの、7Bという軽量なアーキテクチャでこのスコアを達成している点は驚異的といえるでしょう。

次に推論速度について、SGLang-Diffusionのベンチマークでは、RTX 4090 1枚で1024×1024の画像を約18.7秒で生成できることが報告されています。画像編集の場合でも約21.7秒で完了し、ピークGPUメモリ使用量は22.7GiBに収まっています。

もう1つの大きな特徴が透過画像(RGBA)のネイティブサポートです。従来のモデルでは生成後に背景除去の後処理が必要でしたが、Qwen-Image-2.1では最初から透過レイヤー付きの画像をそのまま出力できます。ステッカーやアイコンの制作、合成素材の作成といった用途では、このネイティブ対応が大きなアドバンテージになるでしょう。

Qwen-Image-2.1の安全性・制約

Qwen-Image-2.1の安全性や利用上の制約について確認しておきましょう。

Qwen-Image-2.1の安全性・制約

まず、このモデルはQwen Research License Agreementのもとで公開されています。これは「非商用目的のみ」の利用を許可するライセンスであり、商用利用には別途Qwenチームへの申請が必要です。商用利用を検討している方は、事前にライセンスの確認と手続きを行う必要がある点に注意してください。

また、モデルの重みは約33GBと比較的大きなサイズであるため、動作にはNVIDIA RTX 3090以上のGPUが推奨されます。CPUオフロード機能(pipe.enable_model_cpu_offload())も用意されていますが、あくまで限定的なメモリ環境向けの回避策であり、本格的な運用にはGPUリソースの確保が不可欠です。

Qwen-Image-2.1の料金

Qwen-Image-2.1の利用料金について整理します。前提として、このモデルはオープンウェイトとして公開されているため、自前のGPU環境でローカル実行する場合は、APIの従量課金は発生しません

ただし2026年9月21日時点では、Qwen-Image-2.1専用のホスティングAPIエンドポイントは公式に提供されていません。APIを通じた画像生成サービスとしてはまだ正式に展開されていない状況です。参考として、同シリーズの既存モデルに対するAlibaba Cloud Model Studio(旧DashScope)の料金を記載します。

スクロールできます
モデル名出力解像度出力単価(1枚あたり)無料枠
qwen-image-3.0-pro2K$0.07510枚
qwen-image-3.02K$0.0310枚
qwen-image-2.0-pro$0.075100枚
qwen-image-2.0$0.035100枚
Alibaba Cloud Model Studioにおける画像生成モデルの料金(参考値)

ローカル実行の場合に必要となるハードウェアコストとしては、最低でもVRAM 24GBクラスのGPU(RTX 3090 / RTX 4090等)が目安です。CPUオフロードを活用すれば動作自体は可能ですが、生成速度は大幅に低下するため、実用的に運用するならGPUの確保が前提になるでしょう。

Qwen-Image-2.1のライセンス

Qwen-Image-2.1のライセンスについて詳しく確認しておきましょう。このモデルは、Qwen Research License Agreement(2026年9月20日付)のもとで公開されています。

スクロールできます
利用用途可否備考
商用利用別途Qwenチームへのライセンス申請が必要
改変⭕️研究目的の範囲内で可
再配布⭕️ライセンス条件を維持する必要あり
特許利用
私的利用⭕️
Qwen-Image-2.1のライセンス

前バージョンのQwen-Image(20Bモデル)はApache 2.0ライセンスで商用利用も自由でしたが、Qwen-Image-2.1ではライセンスが変更されています。研究・評価目的であれば自由に利用できますが、ビジネス用途に使いたい場合はQwenチームに連絡して別途商用ライセンスを取得する必要があるため、導入を検討する際はこの点を必ず確認してください。

Qwen-Image-2.1の使い方

Qwen-Image-2.1は複数の方法で利用できます。今回は代表的な使い方をステップバイステップで紹介します。

Diffusers(Python)で画像を生成する

もっとも手軽に始められる方法です。HuggingFace Diffusersライブラリを使ってPythonから直接画像を生成できます。

STEP

環境をセットアップ

Python 3.9以上の環境に、必要なライブラリをインストールします。

pip install torch>=2.4.0
pip install transformers>=5.17
pip install git+https://github.com/huggingface/diffusers
pip install accelerate
pip install pillow
Qwen-Image-2.1の使い方
STEP

テキストから画像を生成(Text-to-Image)

import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night, reflections on wet pavement",
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("t2i_example.png")
STEP

参照画像を使って編集(Image Editing)

from PIL import Image

input_image = Image.open("input.png")

image = pipe(
    prompt="Change the background to a sunset beach",
    image=input_image,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("edit_example.png")
STEP

透過画像(RGBA)を生成する

透過画像を生成するには、プロンプトに透過を指示するフレーズを含めます。

image = pipe(
    prompt="This is an RGBA image with transparency. A cute cartoon dragon sticker. The image has alpha channel and the background is transparent.",
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("transparent_example.png")

GPUメモリが不足する場合は、pipe.enable_model_cpu_offload() を呼び出すことで一部の計算をCPUに退避させることも可能です。

ComfyUIで利用する

ノードベースのワークフローが好みの方には、ComfyUIがDay 0でサポートされています。

STEP

ComfyUIアップデート

ComfyUIを最新版にアップデートしましょう。

STEP

モデルダウンロード

Qwen-Image-2.1の使い方

HuggingFaceからComfy-Org/Qwen-Image-2.1の互換ウェイトをダウンロードし、所定のフォルダに配置します。

STEP

画像生成を実行

公式が提供しているワークフローテンプレート(テキストから画像生成用 / 画像編集用)を読み込んで実行しましょう。

SGLang-Diffusionで高速推論する

大量の画像を効率的に生成したい場合は、SGLang-Diffusionの利用が適しています。コマンド1行で画像を生成できます。

sglang generate \
  --model-path Qwen/Qwen-Image-2.1 \
  --prompt "A capybara reading a book by candlelight" \
  --height 1024 --width 1024 \
  --num-inference-steps 40 --guidance-scale 1 \
  --seed 42 --save-output

画像編集の場合は --image-path input.png を追加するだけで対応できます。

【業界別】Qwen-Image-2.1の活用シーン

Qwen-Image-2.1の機能を活かせる業界ごとの活用シーンを紹介します。画像生成・編集を1つのモデルで統合的に扱えるメリットは、さまざまな業務領域にインパクトを与える可能性を秘めています。

EC・ファッション業界

Qwen-Image-2.1のマルチリファレンス編集機能は、バーチャル試着やコーディネート画像の自動生成に適しています。モデル写真・衣服・靴・アクセサリーなど最大10枚の参照画像を組み合わせることで、商品の着用イメージを効率的に量産できるでしょう。RGBA透過画像の生成にも対応しているため、商品画像の背景切り抜き作業も不要になります。

小売業における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

デザイン・クリエイティブ業界

ステッカーやロゴの制作では透過画像のネイティブ生成が威力を発揮しますし、パノラマ画像やインフォグラフィックの生成もサポートされています。キャラクターの三面図から一貫性のあるストーリーボードを自動生成する機能は、漫画やアニメーションの制作現場で特に注目されるでしょう。

生成AIでクリエイティブ作成する方法について、詳しく知りたい方は以下の記事も参考にしてみてください。

広告・マーケティング業界

人物写真の忠実度が高い点を活かして、一貫したキャラクターが登場する広告シリーズの制作に活用できます。テキストレンダリング精度も向上しているため、ポスターや看板の文字入り画像を直接生成する用途でも精度の高い結果が期待できるでしょう。

広告業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Qwen-Image-2.1が解決できること

続いて、Qwen-Image-2.1が解決できる具体的な課題を整理します。これまで画像生成AIを使う上で壁となっていた問題の多くに、このモデルはアプローチしています。

透過画像の後処理作業をなくす

従来の画像生成AIでは、生成された画像から背景を除去するために別途ツールを使う必要がありました。Qwen-Image-2.1はRGBA透過画像をネイティブで出力できるため、背景切り抜きの後処理工程を丸ごとスキップできます。

複数素材を組み合わせた画像を一発で作る

これまでは複数の素材を合成するためにPhotoshopなどのツールで手作業が必要でしたが、最大10枚の参照画像を一度に入力してテキストで指示するだけで合成画像を生成できます。集合写真の合成やファッションコーディネートの可視化が大幅に効率化されるはずです。

キャラクターの一貫性を保ったまま複数シーンを生成

キャラクターの三面図(正面・側面・背面)を参照画像として渡すことで、同一キャラクターが異なるシーンに登場するストーリーボードを自動生成できます。手動でキャラクターの整合性を保つ煩わしさから解放されるでしょう。

Qwen-Image-2.1を使ってみた

それでは実際にQwen-Image-2.1を試してみましょう。今回は一般的なPCでも試せるよう、ModelScope CIVISIONのオンライン画像生成ページを使って検証を行いました。ブラウザさえあれば誰でもすぐに体験できます。

検証1:ModelScope CIVISIONでテキスト入り画像を生成してみた

以下の手順で、GPUなしのPCからでもQwen-Image-2.1の画像生成を試すことができます。

STEP

デモページへアクセス

ブラウザでModelScopeのQwen-Image-2.1ページへアクセスし、「ワンクリック生成」ボタンからCIVISIONの画像生成ページに遷移します。アカウント登録(無料)が必要です。

Qwen-Image-2.1を使ってみた
STEP

モデル選択

画面左下の「モデル管理」セクションで、チェックポイントが「クウェン/クウェン画像-2.1」(Qwen/Qwen-Image-2.1)になっていることを確認します。

STEP

プロンプト送信

画面上部のプロンプト入力欄に、生成したい画像の説明を入力します。今回は、テキストレンダリング性能の確認も兼ねて以下のプロンプトを使用しました。

プロンプトはこちら
A cozy Japanese cafe interior with a wooden chalkboard menu that reads "COFFEE & MATCHA", warm lighting, plants on the windowsill

出力結果はこちら

生成結果を見ると、温かみのある照明に照らされた木目調のカフェインテリアが写実的に描かれています。窓辺の観葉植物や木製テーブルの質感も自然です。注目のテキストレンダリングについては、黒板上部の「COFFEE & MATCHA」の見出し部分はくっきりと正確に描画されていました。

一方で、その下に並ぶメニュー項目の細かい文字は判読不能な架空のテキストになっていて、指示していない部分のテキストまでは精度が及ばないようです。とはいえ、メインのタイトルテキストが崩れないのは画像生成AIとしては高い水準といえるでしょう。

検証2:日本語テキスト入りの居酒屋画像を生成

続いて、Qwen-Imageシリーズが強みとしている日本語テキストのレンダリング精度を検証してみます。以下のプロンプトで、赤提灯に「居酒屋」、木製看板に「本日のおすすめ」と書かれた画像の生成を指示しました。

プロンプトはこちら
A stylish Japanese izakaya entrance at night with a red paper lantern that reads "居酒屋" and a wooden sign that reads "本日のおすすめ", warm golden light spilling onto the narrow alley, photorealistic

出力結果はこちら

Qwen-Image-2.1を使ってみた

赤提灯に書かれた「居酒屋」の3文字は一画も崩れることなく完璧に描画されていて、木製看板の「本日のおすすめ」も全文字が正確に読み取れる品質でした。

検証1では英語のメニュー詳細が架空テキストになっていたのに対し、日本語のテキストレンダリングは指示どおりの文字が高い精度で再現されています。

Qwen-Image-2.1など生成AIのご相談はWEELへ

Qwen-Image-2.1は、7Bパラメータという軽量さでありながらクローズドソースモデルに匹敵する品質を実現した、注目すべきオープンウェイトの画像生成・編集モデルです。RGBA透過画像のネイティブ生成、最大10枚の参照画像に基づく高品質な編集、ローカル編集の柔軟性など、実務レベルの課題に直結する機能を数多く備えています。

商用利用には別途ライセンスが必要という制約はあるものの、研究・評価目的であれば今すぐ試せる環境が整っています。Diffusers・ComfyUI・vLLM・SGLangといった主要な推論フレームワークがDay 0でサポートしている点も、すぐに導入を検討できる大きなメリットでしょう。

弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。

「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。

開発実績として、

・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント

などの開発実績がございます。

生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。

アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

大規模言語モデル(LLM)比較レポート
LLM比較レポート

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。

セミナー内容や料金については、ご相談ください。

また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。

よくある質問

Qwen-Image-2.1は無料で使えますか?

はい、研究や個人の非商用目的であれば無料で利用できます。HuggingFace・ModelScope・GitHubからモデルの重みをダウンロードし、自分のGPU環境でローカル実行する形式です。ただし、商用利用には別途Qwenチームからの商用ライセンス取得が必要です。

どのくらいのGPUスペックが必要ですか?

公式の推奨環境としてはVRAM 24GB以上のGPU(RTX 3090 / RTX 4090など)が目安です。CPUオフロード機能を使えばメモリの少ない環境でも動作させることは可能ですが、生成速度は大幅に低下します。SGLang-Diffusionのベンチマークでは、RTX 4090で1024×1024画像を約18.7秒で生成できることが報告されています。

前バージョンのQwen-Imageとの違いは何ですか?

大きな違いは3点あります。まずパラメータ数が20Bから7Bに約65%削減されつつ品質が向上した点、次にRGBA透過画像のネイティブ生成に対応した点、そしてライセンスがApache 2.0からQwen Research License(非商用限定)に変更された点です。アーキテクチャも20BのMMDiTから7BのSingle-Stream DiTに刷新されています。

  • URLをコピーしました!
  • URLをコピーしました!
目次