【Qwen-Image-2.1-Turbo】わずか8ステップで2K画像を生成!Alibaba最新モデルの使い方・料金・ライセンスを徹底解説

Qwen-Image-2.1-Turbo 8ステップ 2K 画像 生成 Alibaba 最新 モデル 使い方 料金 ライセンス 徹底 解説
押さえておきたいポイント
  • Qwen-Image-2.1-Turboは、Qwen-Image-2.1をわずか8ステップで動かせる高速版の画像生成・編集モデル
  • 透過PNGの生成や最大10枚の参照画像を使った編集など、通常版と同じ7Bの画像生成部の機能をそのまま利用可能
  • 重みは研究・評価目的に限られ、自社環境での商用利用には別途ライセンスが必要

2026年10月9日、AlibabaのQwenチームが画像生成・編集モデル「Qwen-Image-2.1-Turbo」を公開しました!

通常40ステップかかる生成処理を、たった8ステップで完了させる高速版として登場したモデルです。

【Qwen-Image-2.1-Turbo】わずか8ステップで2K画像を生成!Alibaba最新モデルの使い方・料金・ライセンスを徹底解説

とはいえ、「通常版のQwen-Image-2.1と何が違うの?」「速くなったぶん画質は落ちるのでは?」「仕事で使っても問題ない?」と気になっている方も多いのではないでしょうか。

この記事では、Qwen-Image-2.1-Turboの概要・仕組み・料金・ライセンスから具体的な使い方まで、まとめて解説します。最後まで読めば、Qwen-Image-2.1-Turboを自社の画像制作フローに組み込むべきか判断できるようになるはずです。ぜひ最後までご覧ください!

\生成AIを活用して業務プロセスを自動化/

tamura

【監修者】田村 洋樹

株式会社WEEL代表取締役 / 累計25社以上のAIアドバイザリーを担当 / 企業向けセミナー・大学講義でのべ10,000人超に登壇 / 日本HP・インテルなど、大手企業主催カンファレンスへの登壇実績多数。AI導入支援・生成AIを活用した業務改革のプロとして、アドバイザリー・PM・講演者など多面的な立場から企業を支援中。

目次

Qwen-Image-2.1-Turboとは?

Qwen-Image-2.1-Turboとは?
参考:https://modelscope.cn/models/Qwen/Qwen-Image-2.1-Turbo

Qwen-Image-2.1-Turboは、AlibabaのQwenチームが開発したテキストからの画像生成と画像編集をひとつでこなす生成AIモデルです。Hugging Faceのモデルカードでは、Qwen-Image-2.1を8ステップのノイズ除去で動かせるように高速化したチェックポイントと説明されています。

ベースとなったQwen-Image-2.1は、2026年9月20日に公開されたオープンウェイトの画像生成モデルです。

Qwen-Image-2.1-Turboとは?
参考:https://x.com/Alibaba_Qwen/status/2101659302792679789?s=20

画像生成部はわずか7Bパラメータという軽量設計でありながら、テキストからの画像生成・画像編集・透過画像の生成までを1つのモデルで扱えるのが強みとなっています。

Turboは、この通常版と同じ7Bの画像生成アーキテクチャをそのまま使っています。違いは推論の進め方で、通常版の既定値が40ステップなのに対し、Turboはチェックポイントに保存された8ステップのサンプリングスケジュールで動作するのがポイント。

対応しているタスクは、テキストからの画像生成と、入力画像をもとにした画像編集の2つです。公式のショーケースでは、ポートレート写真・人物のポーズ・透過画像・タイポグラフィやポスター・UIや情報レイアウト・複数参照画像の合成といったカテゴリの8ステップ出力例が紹介されているので、気になる方はチェックしてみてください。

ベースとなっているQwen-Image-2.1についてはこちら

Qwen-Image-2.1-Turboの仕組み

Qwen-Image-2.1-Turboの中身は、通常版のQwen-Image-2.1とまったく同じ構成です。

Qwen-Image-2.1-Turboの仕組み

公式GitHubで公開されているアーキテクチャは、大きく4つのモジュールで構成されています。

スクロールできます
モジュール役割
テキストエンコーダー(Qwen3-VL 8B)テキストの指示と参照画像をまとめて1つの表現に変換する
Transformer(Single-Stream DiT・32層・7B)ノイズから画像の潜在表現を少しずつ復元する本体
VAE(64チャンネルのRGBAオートエンコーダー)潜在表現を16倍の空間圧縮から画像に戻す。透過チャンネルにも対応
スケジューラー(Flow Matching+Euler)どのノイズレベルで何回処理するかを決める
Qwen-Image-2.1-Turboを構成する主要モジュール

注目したいのが、Transformerに採用されている「混合粒度アテンション」という仕組みです。テキストには1トークンずつの因果マスク、画像にはまとまり単位の双方向マスクを使い分けています。この設計のおかげで、入力画像と編集指示は最初のステップで1回計算すれば、その結果をキャッシュとして後のステップでも使い回せるわけです。

Turboはこの土台の上に、2つの高速化を重ねています。1つ目は、チェックポイントのmodel_index.jsonに保存された8段階のノイズレベル(sigma)です。値は「1.0→0.978453→0.95418→0.926626→0.89508→0.845148→0.704534→0.414568」と前半に細かく、後半で一気に進む不均等な刻み方になっています。

2つ目は、既定のCFG(分類器フリーガイダンス)を1にしている点です。CFGを1にすると、1ステップあたりの推論は1回で済みます。さらにプレフィックスKVキャッシュでテキストと参照画像の計算を全ステップで再利用するため、編集時の無駄な計算も大きく削れるのです。

Qwen-Image-2.1-Turboの特徴

Qwen-Image-2.1-Turboの特徴
参考:https://github.com/QwenLM/Qwen-Image-2.1

Qwen-Image-2.1-Turboの強みは、通常版の多機能さを保ったまま推論を軽くしている点です。ここからは、公式が公開している数値やショーケースをもとに、実務で効いてくる特徴を4つに絞って紹介します。

ステップ数を5分の1に減らした高速生成

いちばんの特徴は、通常版の既定値である40ステップを8ステップまで減らしていることです。DiT本体が画像を復元する回数がそのまま5分の1になるため、GPUの使用時間を大幅に削れます。

しかも、推奨スケジュールはチェックポイントに同梱済み。DiffusersでQwenImage21Pipelineを読み込むだけで8ステップ設定が自動で適用されるので、スケジューラーを手作業で調整する必要はありません。

ベースモデルはQwen-Image-Benchで60.28を記録

Turboそのもののスコアはないものの、ベースとなるQwen-Image-2.1の実力は公式ブログで確認できます。

Qwen-Image-2.1-Turboの特徴
参考:https://qwen.ai/blog?id=qwen-image-2.1

Qwen独自の評価指標であるQwen-Image-Benchでは、総合スコア60.28を記録しました。

比較グラフでは、これより上位にGPT Image系やGrok Imagineなど、パラメータ数が公開されていないクローズドモデルが並んでいます。一方で、パラメータ数を公開しているモデルと比べると、7Bという小ささで上位に食い込んでいる点が目を引くところ。

同じグラフ内には、20Bの前世代Qwen-Imageや80B級のモデルも並んでいます。数分の1のサイズでこうしたモデルを上回るスコアを出している点は、軽さを重視する現場にとって大きな魅力でしょう。

透過PNGの生成と最大10枚の参照画像に対応

Turboは通常版と同じアーキテクチャを使っているため、Qwen-Image-2.1の多機能さをそのまま引き継いでいます。代表的なのが、背景が透明なRGBA画像をネイティブで生成できる点です。

公式GitHubでは、透過画像を生成するときのプロンプトの型として「This is an RGBA image with transparency.」で始めて、「The image has alpha channel and the background is transparent.」で締める書き方が推奨されています。ロゴやステッカー、EC用の商品素材を切り抜きなしで作れるのはうれしいポイントですね。

編集機能も充実しています。最大10枚の参照画像を組み合わせた合成や、丸囲み・塗りつぶし・マスクによる部分編集、人物の顔立ちや商品の文字・質感を保ったままの編集が可能です。Turboの公式ショーケースにも、複数画像からの合成例や4枚の画像からインテリアを組み立てる例が掲載されています。

文字描画とポートレートの質感が向上

Qwen-Image-2.1は、文字描画とポートレートの表現力にも力を入れているモデルです。公式ブログでは、文字の内容だけでなく書体やレイアウト、画面全体との関係まで考慮して描画するとのこと。

Turboの公式ショーケースにも「タイポグラフィとポスターデザイン」や「UIと情報レイアウト」のカテゴリがあり、8ステップでも文字入りのデザインを生成できることがアピールされています。化学の授業ノート風ポスターを1枚で描き切る公式サンプルコードは、まさにその象徴といえるでしょう。

さらに、短いプロンプトを詳細な指示文に書き直す公式のプロンプト拡張モデルも公開済みです。Qwen3.5-VL 9Bをベースにした画像生成用(PE-T2I)と編集用(PE-I2I)の2種類があり、Turboと組み合わせれば短い指示でも完成度を引き上げやすくなります。

Qwen-Image-2.1-Turboの安全性・制約

Qwen-Image-2.1-Turboは手軽に使える反面、導入前に知っておきたい制約がいくつか存在するのも事実です。ここでは、公式ドキュメントとライセンス文書から読み取れる注意点を整理しておきましょう。

まず押さえておきたいのが、モデルカードに安全性評価や有害な出力を防ぐフィルタに関する専用の記載がないことです。ライセンス文書では、マテリアルは「現状有姿」で提供され、マテリアルやその出力の安全性・安定性について保証も責任も負わないと明記されています。

そのため、人物画像や商標を含む画像を扱う場合は、利用者側で出力をチェックする体制が欠かせません。また、Alibaba Cloud Model StudioのAPIでは、透かしを入れるwatermarkパラメータの既定値がfalseとなっています。生成画像であることを明示したいケースでは、自分でオンに切り替えてください。

Qwen-Image-2.1-Turboの料金

Qwen-Image-2.1-Turboは、重みをダウンロードして自前の環境で動かす場合、モデルの利用料はかかりません。一方、Alibaba Cloud Model StudioのAPIで使う場合は、1枚単位の従量課金になります。

上位版のQwen-Image-2.1 Proと比べると、1枚あたりの単価は4割、1分あたりのリクエスト上限は6倍という価格設定です。大量に画像を作る用途ほど、Turboを選ぶ価値が高まるでしょう。

スクロールできます
モデルリージョン料金(1枚あたり)レート制限
qwen-image-2.1-turboシンガポール(国際版)0.016ドル120RPM
qwen-image-2.1-turbo米国(バージニア)・ドイツ(フランクフルト)・日本(東京)・香港0.014133ドル120RPM
qwen-image-2.1-turbo中国(北京)0.014133ドル120RPM
qwen-image-2.1-proシンガポール(国際版)0.04ドル20RPM
qwen-image-2.1-pro米国(バージニア)・ドイツ(フランクフルト)・日本(東京)・香港0.035333ドル20RPM
qwen-image-2.1-pro中国(北京)0.035333ドル20RPM
オープンウェイト版(自前実行)―無料(GPU・電気代などは自己負担)―
Qwen-Image-2.1-TurboとProのAPI料金(2026年10月時点、キャンペーン価格を除く定価)

シンガポールリージョンの定価で計算すると、Turboで1,000枚生成しても16ドルです。同じ枚数をProで作ると40ドルかかるため、試行錯誤しながら大量の候補を出す使い方ならTurboのほうが圧倒的に有利になります。

Qwen-Image-2.1-Turboのライセンス

Qwen-Image-2.1-Turboの重みは、通常版と同じ「Qwen Research License Agreement」で公開中です。オープンウェイトとはいえ、Apache 2.0のような自由なライセンスではない点には注意しましょう。

スクロールできます
利用用途可否条件・補足
商用利用❌️別途商用ライセンスの取得が必要
改変⭕️非商用目的に限り可。改変したファイルには変更した旨を明記
再配布⭕️非商用目的に限り可。ライセンス文書の同梱と所定の帰属表示が必要
特許利用🔺特許に関する明示的な条項はなし。権利侵害を理由にQwen側を提訴するとライセンスは終了
私的利用🔺研究・評価目的の範囲であれば可
Qwen-Image-2.1-Turboのライセンス(Qwen Research License Agreement)

なお、Alibaba Cloud Model StudioのAPI経由で使う場合は、Alibaba Cloud側の利用規約も関わってきます。自社サービスへの組み込みを考えている場合は、重みを使うのかAPIを使うのかで確認すべき規約が変わるため、法務担当者とあわせて事前に確認しておくと安心です。

Qwen-Image-2.1-Turboの使い方

Qwen-Image-2.1-Turboは、Diffusersを使ったPythonコード、ComfyUI、Alibaba Cloud Model StudioのAPIという3つの方法で利用できます。ここからは、それぞれの手順をステップごとに見ていきましょう。

Diffusersでローカル実行する方法

自前のGPU環境で動かしたい場合は、公式が推奨するDiffusersを使うのがいちばんの近道です。PyPI版ではなくソースからインストールした最新のDiffusersが必要になる点だけ、最初に押さえておいてください。

STEP

ライブラリインストール

まずは、CUDAに対応したPyTorchを用意したうえで、必要なライブラリをインストールしましょう。

pip install git+https://github.com/huggingface/diffusers.git
pip install "transformers>=5.17.0" accelerate pillow
STEP

コード実行

続いて、Pythonでパイプラインを読み込み、テキストから画像を生成します。8ステップのスケジュールは自動で適用されるので、ステップ数を指定する必要はありません。

import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo",
    dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt="A cozy Japanese cafe storefront at dusk, a wooden sign that reads \"WEEL CAFE\", warm lights, photorealistic",
    width=2048,
    height=2048,
    use_kv_cache=True,
    generator=torch.Generator("cpu").manual_seed(42),
).images[0]

image.save("turbo_t2i.png")
STEP

画像編集

画像を編集したいときは、同じパイプラインにimage引数で入力画像を渡しましょう。公式サンプルでは、ヨットの手描きスケッチを写真のような画像に変換していました。

from diffusers.utils import load_image

input_image = load_image(
    "https://huggingface.co/Qwen/Qwen-Image-2.1-Turbo/resolve/main/assets/turbo-boat-input.png"
).convert("RGBA")

edited = pipe(
    prompt="Create a photorealistic photograph of the motor yacht from the input sketch, sailing on open sea.",
    image=input_image,
    width=2048,
    height=2048,
    use_kv_cache=True,
    generator=torch.Generator("cpu").manual_seed(43),
).images[0]

edited.save("turbo_edit.png")

出力サイズは、1:1(2048×2048)・16:9(2752×1536)・9:16(1536×2752)など、通常版と同じ7種類のプリセットが推奨されています。GPUのメモリが足りない場合は、from_pretrainedのあとにpipe.enable_model_cpu_offload()を呼び出すと、一部のモジュールをCPUに逃がしながら実行できるでしょう。

ComfyUIで使う方法

ノードを組み合わせてワークフローを作りたい方は、ComfyUIを使う方法がおすすめです。ComfyUIの公式チームがComfy-Org/Qwen-Image-2.1にTurbo用の重みを公開しているため、通常版のワークフローがあればモデルを差し替えるだけで試せます。

STEP

ComfyUIをアップデート

Qwen-Image-2.1-Turboの使い方
参考:https://github.com/comfy-org/comfyui

ComfyUIを最新版にアップデートしましょう。Qwen-Image-2.1は公開初日からComfyUIにネイティブ対応済みです。

STEP

ファイルをダウンロード

Qwen-Image-2.1-Turboの使い方
参考:https://huggingface.co/Qwen/Qwen-Image-2.1-Turbo

Comfy-Org/Qwen-Image-2.1から、次のファイルをダウンロードしてComfyUIのmodelsフォルダ内の同名フォルダに配置します。

スクロールできます
配置先フォルダファイル名サイズ
diffusion_modelsqwen_image_2.1_turbo_bf16.safetensors約14.23GB
diffusion_models(省メモリ版)qwen_image_2.1_turbo_int8_convrot.safetensors約7.26GB
text_encodersqwen3vl_8b_bf16.safetensors(またはint8・w4a8版)約17.53GB(int8版は約9.35GB)
vaeqwen_image_2.1_vae_bf16.safetensors約0.68GB
ComfyUIでQwen-Image-2.1-Turboを動かすために必要なファイル
STEP

テンプレート選択と設定

ComfyUIのテンプレートからQwen-Image-2.1のテキストからの画像生成ワークフローを読み込み、拡散モデルの読み込みノードでTurboのファイルを選んでください。

サンプラーのステップ数を8、CFGを1に設定して実行すれば完了です。通常版の重みを使い回したい場合は、同リポジトリにあるTurbo用LoRA(qwen_image_2.1_turbo_lora_avg_rank_178_bf16.safetensors)を通常版に適用する方法もあります。

Alibaba Cloud Model StudioのAPIで使う方法

GPUを用意せずにアプリへ組み込みたい場合は、Alibaba Cloud Model StudioのAPIを使いましょう。Turboはリクエスト上限が120RPMと高めに設定されているため、バッチ処理や社内ツールへの組み込みにも向いています。

STEP

APIキー発行&環境変数設定

Alibaba Cloudのアカウントを作成し、Model Studioのコンソールで利用したいリージョンのAPIキーを発行します。

Qwen-Image-2.1-Turboの使い方

発行したAPIキーを環境変数DASHSCOPE_API_KEYに設定しておきましょう。

export DASHSCOPE_API_KEY="発行したAPIキー"
STEP

コード実行

公式ドキュメントで推奨されているDashScopeの同期APIに、モデル名qwen-image-2.1-turboを指定してリクエストを送ります。{WorkspaceId}の部分は、コンソールに表示されるご自身のワークスペースIDに置き換えてください。

import os
import requests

url = "https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation"
headers = {
    "Content-Type": "application/json",
    "Authorization": f"Bearer {os.environ['DASHSCOPE_API_KEY']}",
}
payload = {
    "model": "qwen-image-2.1-turbo",
    "input": {
        "messages": [
            {
                "role": "user",
                "content": [
                    {"text": "桜並木の下に置かれた和菓子の商品写真、やわらかな自然光"}
                ],
            }
        ]
    },
    "parameters": {"size": "2048*2048", "n": 1, "prompt_extend": True},
}

res = requests.post(url, headers=headers, json=payload, timeout=600)
print(res.json()["output"]["choices"][0]["message"]["content"][0]["image"])

画像を編集する場合は、contentの中で{"image": "画像のURL"}を{"text": "編集指示"}の前に追加すればOKです。2.1系では参照画像を1〜10枚まで渡せるほか、OpenAI互換のエンドポイントからも呼び出せます。返ってくる画像URLは24時間で失効するため、受け取ったらすぐに保存しておきましょう。

【業界別】Qwen-Image-2.1-Turboの活用シーン

Qwen-Image-2.1-Turboは、軽さと多機能さを両立しているぶん、幅広い業界で使い道があります。ここからは、業界ごとにどのような使い方が向いているのかを具体的に見ていきましょう。

広告・マーケティング業界

広告・マーケティング業界では、バナーやSNS投稿用の画像案を短時間で大量に出す用途に向いています。8ステップで生成できるため、1つのコンセプトから色味や構図を変えた候補を何十パターンも並べて比較するといった使い方がしやすいからです。

さらに、Qwen-Image-2.1系は文字描画にも力を入れているモデル。キャッチコピー入りのポスター案を作ってから手作業で仕上げるという流れにすれば、デザイナーの方が最初のラフを描く時間を大きく減らせるでしょう。

API料金もシンガポールリージョンで1枚0.016ドルと安価なため、A/Bテスト用の広告案を多めに用意しても予算を圧迫しにくいのが魅力です。

広告業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

EC・小売業界

EC・小売業界では、透過PNGで商品素材を作り、さまざまな背景に合成する使い方がうってつけでしょう。背景が透明な画像を最初から生成できるので、切り抜き作業を挟まずにバナーやLPに配置できます。

また、最大10枚の参照画像を使った編集も強力な武器です。公式ブログでは、モデル・服・靴・バッグ・帽子の5枚を組み合わせてコーディネート画像を作る例が紹介されています。

商品の文字や質感を保ったまま編集できるため、パッケージ写真をもとにした季節ごとのメイン画像作りにも応用しやすいはずです。ただし、自社環境で重みを使う場合は商用ライセンスが必要になる点を忘れないでください。

小売業における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

教育・出版業界

教育・出版業界では、図解入りの学習教材やインフォグラフィックのラフ作成に役立ちます。公式のサンプルコードでは、化学反応式や比較表、実験の図解までを含む授業ノート風のポスターを1枚の画像として生成していました。

長く詳細なプロンプトにもしっかり従う設計のため、教材の構成を文章で指定してレイアウト案を作るといった使い方と相性が良いでしょう。

もちろん、図の中に書かれた化学式や数値が正しいかどうかは、必ず担当者の目で確認してください。あくまで構成案を素早く形にするための道具として使うのが現実的な落としどころです。

教育業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Qwen-Image-2.1-Turboが解決できること

続いては、画像制作の現場でよくある課題に対して、Qwen-Image-2.1-Turboがどのように役立つのかを解説します。自社の悩みに近いものがないか、チェックしながら読み進めてみてください。

画像生成の待ち時間を短縮できる

生成AIで画像を作るとき、1枚の生成に時間がかかりすぎて試行錯誤が進まないという悩みは少なくありません。Qwen-Image-2.1-Turboなら、通常版の40ステップに対して8ステップで生成が終わるため、DiT本体の処理回数を5分の1に減らせます。

さらにCFGが1に固定されているので、1ステップあたりの推論回数も最小限に抑えられるのがポイント。編集時にはプレフィックスKVキャッシュが参照画像の計算を使い回すため、参照画像が多いほど効果を実感しやすいでしょう。

プロンプトを少し変えては生成し直すという作業をテンポよく回せるようになれば、最終的な画像の完成度も上げやすくなるはずです。

透過素材の切り抜き作業をなくせる

ロゴやアイコン、商品素材を作るたびに背景を切り抜く作業は、地味ながら手間のかかる工程ですよね。Qwen-Image-2.1-TurboはRGBA画像をネイティブで生成できるため、最初から背景が透明な素材を作れます。

公式ブログによると、通常のRGB写真から目的の被写体だけを透過レイヤーとして取り出すこともできるそうです。透過画像に含まれる文字を書き換える編集にも対応しているので、素材を作り直す手間を減らせます。

画像編集ソフトでの切り抜きに毎回時間を取られている方にとっては、作業工程そのものを見直すきっかけになるでしょう。

大量生成にかかるコストを抑えられる

画像生成APIを業務で使うと、枚数が増えるほど費用が膨らむのが悩みどころです。Qwen-Image-2.1-TurboのAPIは、シンガポールリージョンで1枚あたり0.016ドルとProの4割の価格に設定されています。

レート制限もProの20RPMに対して120RPMと6倍に緩和されているため、大量の画像を一気に処理するバッチ用途でも詰まりにくいのが特徴です。自前のGPUで動かす場合も、ステップ数が少ないぶん1枚あたりのGPU使用時間を短くできます。

まずはTurboで候補を大量に出し、採用する画像だけをProで仕上げるといった使い分けも有効でしょう。

Qwen-Image-2.1-Turboを使ってみた

ここからは、Qwen-Image-2.1-Turboを実際に試してみます。今回はAlibaba Cloud Model StudioのAPIをPythonから呼び出し、「日本語の文字描画」と「透過PNGの生成」の2点を検証しました。

事前準備として、Model Studioのコンソールでシンガポールリージョンのワークスペースを作成し、APIキーを発行しておきます。続いて、必要なライブラリをインストールし、APIキーとワークスペースIDを環境変数に設定します。

pip install requests pillow
export DASHSCOPE_API_KEY="発行したAPIキー"
export WORKSPACE_ID="ワークスペースID"

検証に使用した全体コードはこちらです。2つのプロンプトを順番に送り、生成画像の保存・応答時間の計測・透過チャンネルの確認までをまとめて実行します。日本語の文字を書き換えられないよう、プロンプトの自動拡張(prompt_extend)はオフにしました。

コードはこちら
import os
import time
from io import BytesIO

import requests
from PIL import Image

API_KEY = os.environ["DASHSCOPE_API_KEY"]
WORKSPACE_ID = os.environ["WORKSPACE_ID"]
URL = f"https://{WORKSPACE_ID}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation"
MODEL = "qwen-image-2.1-turbo"

TESTS = [
    {
        "name": "poster_ja",
        "size": "1536*2048",
        "prompt": (
            "A vertical poster for a Japanese summer festival. "
            "At the top, large bold brush lettering reads \"夏祭り\". "
            "Below it, smaller text reads \"8月15日 18:00〜\". "
            "Fireworks bloom in a navy night sky, paper lanterns line the bottom edge, "
            "warm festive atmosphere."
        ),
    },
    {
        "name": "sticker_rgba",
        "size": "2048*2048",
        "prompt": (
            "This is an RGBA image with transparency. "
            "A cute cartoon cat mascot holding a laptop, thick white sticker outline, flat colors. "
            "The image has alpha channel and the background is transparent."
        ),
    },
]


def generate(prompt, size):
    headers = {
        "Content-Type": "application/json",
        "Authorization": f"Bearer {API_KEY}",
    }
    payload = {
        "model": MODEL,
        "input": {"messages": [{"role": "user", "content": [{"text": prompt}]}]},
        "parameters": {"size": size, "n": 1, "prompt_extend": False, "seed": 42},
    }
    start = time.perf_counter()
    res = requests.post(URL, headers=headers, json=payload, timeout=600)
    res.raise_for_status()
    elapsed = time.perf_counter() - start
    image_url = res.json()["output"]["choices"][0]["message"]["content"][0]["image"]
    return image_url, elapsed


for test in TESTS:
    image_url, elapsed = generate(test["prompt"], test["size"])
    image = Image.open(BytesIO(requests.get(image_url, timeout=60).content))
    path = f"{test['name']}.png"
    image.save(path)
    print(f"[{test['name']}] {elapsed:.1f}秒 / {image.size[0]}x{image.size[1]} / mode={image.mode} -> {path}")

    if "A" in image.getbands():
        alpha = image.getchannel("A").histogram()
        print(f"  透明に近い画素の割合:{sum(alpha[:128]) / sum(alpha):.1%}")
Qwen-Image-2.1-Turboを使ってみた

出力結果はこちら

Qwen-Image-2.1-Turboを使ってみた

「夏祭り」の筆文字も「8月15日 18:00〜」の小さな日付も、一字の崩れもなく正確に描画されました。花火や提灯の描き込みも細かく、応答時間はわずか10.0秒。このままSNS告知に使えそうな完成度です。

背景の約6割が透明になっており、白いフチ取りに沿ってきれいに切り抜かれた状態で出力されました。応答時間も10.1秒と高速です。

2枚とも約10秒で2K画像が返ってきており、8ステップならではの速さを実感できました。日本語の文字描画と透過PNGという実務で需要の高い2点を、どちらも高い精度でこなせるのはTurboの大きな魅力といえるでしょう。

Qwen-Image-2.1-Turboなど生成AIのご相談はWEELへ

Qwen-Image-2.1-Turboなら、7Bの軽量な画像生成部を持つQwen-Image-2.1を、わずか8ステップで動かせます。透過PNGの生成や最大10枚の参照画像を使った編集といった通常版の強みを残したまま、生成にかかる時間とコストを大きく削れるのが最大の魅力です。

弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。

「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。

開発実績として、

・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント

などの開発実績がございます。

生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。

アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

大規模言語モデル(LLM)比較レポート
LLM比較レポート

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。

セミナー内容や料金については、ご相談ください。

また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。

よくある質問

Qwen-Image-2.1-Turboは商用利用できますか?

いいえ、ダウンロードした重みをそのまま商用利用はできません。重みはQwen Research License Agreementで公開されており、研究・評価目的に限定されるライセンスです。自社環境で商用利用したい場合は、Qwenチームから別途商用ライセンスを取得する必要があります。Alibaba Cloud Model StudioのAPIを使う場合は、Alibaba Cloud側の利用規約もあわせて確認してください。

通常版のQwen-Image-2.1とは何が違いますか?

主な違いは、推論のステップ数とその設定です。どちらも同じ7Bの画像生成アーキテクチャを使っていますが、通常版の既定値が40ステップなのに対し、Turboは保存済みの8ステップスケジュールとCFG=1で動作します。透過画像の生成や最大10枚の参照画像を使った編集など、機能面は共通です。

num_inference_stepsを変えればステップ数を増やせますか?

いいえ、num_inference_stepsだけを変更しても、保存済みの8ステップスケジュールは上書きされません。呼び出し時にsigmasを明示的に渡せば上書きできますが、公式は他のスケジュールでの品質を評価していないと説明しています。基本的には既定の8ステップのまま使うのがおすすめです。

  • URLをコピーしました!
  • URLをコピーしました!
目次