MiniMax APIとは?料金・使い方・実践検証を解説

- MiniMax APIはテキスト・画像・動画・音声の生成を1つのキーで扱えるマルチモーダルAPI
- 主力モデルMiniMax-M3は100万トークンの文脈長を持ち、入力100万トークンあたり0.3ドル
- OpenAI SDKのbase_urlを差し替えるだけで既存コードから呼び出せる
MiniMax APIは、テキスト・画像・動画・音声の生成を1つのキーで呼び出せるサービスです。開発元は2026年1月に香港上場した中国のAI企業で、入力単価は100万トークンあたり0.3ドルです。

とはいえ「日本から使えるのか」「既存のOpenAI連携を作り直すのか」と迷う方も多いのではないでしょうか。この記事では料金・APIキーの取得・Pythonでの実装を、実際にAPIを動かした結果とあわせて解説します。読み終えれば自社に組み込むべきか判断できます。
\生成AIを活用して業務プロセスを自動化/
MiniMax APIとは

MiniMax APIは、中国・上海のAI企業MiniMaxが開発する生成AIのAPIです。テキスト・動画・音声・画像の4分野を、共通のAPIキーとエンドポイントから呼び出せる点が最大の特徴といえます。
同じことをOpenAI・Google・ElevenLabsで分担させると、契約先も請求書も監視対象も3つに増えます。MiniMaxはそこを1本にまとめられるうえ、主力のテキストモデルMiniMax-M3は入力100万トークンあたり0.3ドルという低価格帯です。
なお日本からも、国際版のプラットフォーム経由で問題なく利用できます。まずは全体像を押さえておきましょう。
MiniMax社・MiniMax APIの概要
MiniMaxは2021年12月に設立された、中国・上海を拠点に生成AIを開発する企業です。創業者のYan Junjie(闫俊杰)氏は、画像認識大手SenseTimeの出身として知られています。
一般向けにはAIキャラクターアプリ「Talkie」や動画生成サービス「Hailuo AI」を展開しており、2026年1月9日には香港証券取引所へ上場しました。銘柄コードは0100で、公開価格は1株165香港ドル、発売株式数は約2,920万株です(※1)。
テキストモデルのMiniMax-M3は重みを公開しており、自社サーバーでの実行も選べます。そのためクラウドに出せないデータを扱う企業でも、検討の余地があるでしょう。
MiniMax APIで使える4つのモダリティ
MiniMax APIで利用できるのは、2026年9月時点では以下の4分野です。
| 分野 | 現行モデル | 主なスペック |
|---|---|---|
| テキスト生成 | MiniMax-M3 | 総パラメータ428BのMoE、文脈長100万トークン |
| 動画生成 | MiniMax-H3 | 768P・2K対応、4〜15秒、音声を同時生成 |
| 音声合成 | speech-2.8-hd・turbo | 40言語に対応、10秒の音声からクローン可能 |
| 画像生成 | image-01 | テキストからの生成と画像からの生成に対応 |
注目したいのは動画のMiniMax-H3で、映像と音声を同時に生成します。BGMやナレーションを別途合成する工程が省けるため、動画制作の自動化を考えるうえで効いてきます。
なお音楽生成APIについては、公式ドキュメントによると2026年8月20日より新規ユーザーへの提供が終了しています。これから登録する場合は使えないため、音楽生成を前提とした設計は避けてください。
マルチモーダルAIの仕組みそのものを詳しく知りたい方は、下記の記事をあわせてご確認ください。

【検証】MiniMax APIのテキスト生成を実際に試してみた

実際に従量課金でAPIキーを取得し、MiniMax-M3に業務を想定したプロンプトを投げて計測しました。出力の品質は実務に耐える水準です。
ただし既定の設定のままでは応答に約17秒かかり、思考を切った設定と比べて課金額が約20倍に膨らみます。ここが最大の落とし穴でした。
検証方法・使用したプロンプト
OpenAI互換エンドポイント(https://api.minimax.io/v1)にPythonからストリーミングで接続し、2種類のタスクを投げました。
| タスク | 投げた内容 |
|---|---|
| 業務文書の要約 | 社内ヘルプデスクの月次報告(問い合わせ件数や内訳の数値を含む5行)を150文字以内に要約させる |
| コード生成 | CSVを読み込んで欠損値を中央値で補完する関数を、型ヒントとdocstring付きで書かせる |
モデルはMiniMax-M3、パラメータは既定値のままです。コストは公式単価(100万トークンあたり入力0.3ドル・出力1.2ドル)から算出しました。
出力結果と精度・速度の所感
結論からいえば、出力の精度に不満はなく、課題は速度とコストのほうに出ました。実測値は以下のとおりです。
| 項目 | 業務文書の要約 | コード生成 |
|---|---|---|
| 初回トークンまでの時間 | 1.74秒 | 1.08秒 |
| 総所要時間 | 13.29秒 | 4.91秒 |
| 入力トークン | 307 | 215 |
| 出力トークン | 2,416(推論1,883) | 717(推論66) |
| 回答本文の文字数 | 131文字 | 2,060文字 |
| 概算コスト | 約0.003ドル | 約0.0009ドル |
品質は問題ありませんでした。要約は指定した数値をひとつも落とさずに150文字以内へ収まっています。コードのほうは型ヒントとdocstringに加えて例外処理まで書かれており、str | Pathという記法がPython 3.10以降でしか使えない点まで注記されていました。
注目してほしいのは、131文字の要約のほうが、2,060文字のコード生成よりコストが約3倍高いという逆転です。要約では出力トークンの78%が推論トークンでした。つまり応答速度とコストを決めているのは、出力の長さではなく内部で思考した量だといえます。
既定のままでは「思考過程」が本文に混入する
MiniMax-M3は推論モデルのため、既定では思考過程が<think>…</think>という形で回答本文(content)にそのまま入ってきます。このままチャットボットに組み込むと、ユーザーの画面に思考の独り言が表示されてしまいます。除去処理は必須と考えてください。
そこで思考を制御するパラメータを4通り試し、同じ要約タスクで比較しました。なお計測はここまでの表とは別の回に行っているため、既定の数値は先ほどの13.29秒・2,416トークンとは一致しません。
| 設定 | 所要時間 | 出力トークン | 概算コスト | 本文への混入 |
|---|---|---|---|---|
| 既定(指定なし) | 16.73秒 | 3,181 | 0.003909ドル | あり |
| thinking: disabled | 0.99秒 | 88 | 0.000194ドル | なし |
| thinking: adaptive | 6.15秒 | 855 | 0.001118ドル | あり |
| reasoning_split: true | 12.76秒 | 550 | 0.000752ドル | なし(分離) |
thinkingをdisabledにすると、既定より16.9倍速くなり、コストは20.2分の1に下がりました。しかも要約タスクでは品質が落ちるどころか、情報量が増えて文章も自然になっています。要約・分類・定型文の生成のように考え込む必要がないタスクなら、切るほうが速く安く、結果も良いわけです。
思考過程を残したい場合はreasoning_split: trueを指定します。推論がreasoning_contentという別フィールドに分離されるため、本文を汚さずログへ残せます。ただし思考自体は行われるので、コストは下がりません。
なおadaptiveでは出力855トークンに対し推論981トークン、reasoning_splitでは出力550トークンに対し推論717トークンと、推論トークン数が出力トークン数を上回る不可解な値が返りました。内訳の定義は公式ドキュメントに記載がないため、本番導入前にコンソールの「API Usage」で実請求額を突き合わせることをおすすめします。
【検証】MiniMax APIの画像・動画生成を試してみた

続いて画像生成のimage-01と、動画生成のMiniMax-H3を動かしました。どちらも品質は高い一方、画像は日本語の文字が読める形にならず、動画はエンドポイントの仕様が他のAPIと違うという、事前に知らないと確実につまずく点が見つかりました。
画像生成APIの検証結果
POST /v1/image_generationに3パターンのプロンプトを投げました。条件は16:9・1枚ずつ・base64形式で統一しています。
| ケース | プロンプト言語 | 所要時間 | 結果 |
|---|---|---|---|
| A オフィス風景 | 日本語 | 21.76秒 | 高品質。指示どおり |
| B 同じ内容 | 英語 | 17.11秒 | 高品質。Aと差はない |
| C 看板に「営業中」の文字 | 日本語 | 55.05秒 | 文字が完全に破綻 |
まず朗報から。日本語のプロンプトをそのまま投げても、英語で投げた場合と品質差はありませんでした。写実性・構図・採光のいずれも実用水準で、わざわざ英訳する前処理は要りません。
問題はケースCです。「白い看板に黒い日本語の文字で『営業中』と大きく書かれている」と指示したところ、看板に描かれたのは日本語として存在しない文字列でした。漢字やひらがなに似た字形にはなるものの、1文字も読めません。
つまりバナー・サムネイル・店頭POPのように文字が主役になる画像は作れず、文字は後工程でデザインツールを使って乗せる運用が前提になります。なおこのケースだけ55.05秒と他の2.5〜3.2倍かかっており、文字を描かせようとすると処理時間まで伸びる点も覚えておいてください。
動画生成API(H3)の検証結果
H3は他のAPIとエンドポイントもリクエスト形式も違います。/v1/video_generationにH3を指定すると、エラーとともに/v2/video_generationを使うよう指示されます。さらに/v2ではプロンプトをpromptではなくcontentという配列に入れる必要があり、ratio(アスペクト比)の指定も必須です。
payload = {
"model": "MiniMax-H3",
"content": [{"type": "text", "text": PROMPT}],
"ratio": "16:9",
"duration": 6,
"resolution": "768P",
}「日本のオフィスで、窓際の席に座った会社員がノートパソコンの画面を見ながらゆっくり顔を上げて微笑む」というプロンプトで、6秒の動画を作らせてみました。
| 項目 | 実測値 |
|---|---|
| 所要時間 | 139.8秒(待機約30秒+生成約110秒) |
| 実解像度 | 1344×768(「768P」指定時) |
| フレームレート | 24fps |
| ファイルサイズ | 約638KB |
処理は非同期です。リクエストでtask_idを受け取り、/v2/query/video_generation/{task_id}を10秒ほどの間隔で照会して完了を待つと、レスポンスにダウンロードURLが返ります。同期処理の画像生成とは実装が別物になるため、工数の見積もりには注意してください。
品質は実写と見まがうほどの水準です。「ゆっくり顔を上げて微笑む」という動作指示が反映されており、ブラインド越しの自然光・背景の同僚・机上の書類まで破綻がありませんでした。
そして大きな特徴は、音声トラックが最初から入っている点です。生成されたmp4には映像(h264)とは別に音声(aac・32kHz・ステレオ)が含まれており、無音ではなく環境音がきちんと鳴っていました。
ひとつ注意点として、H3は前払いの動画パッケージの対象外です。公式ドキュメントにも「Video packages support Hailuo video models. MiniMax H3 is not supported yet.」と明記されているため、従量課金で利用してください。
【検証】MiniMax APIの音声合成(TTS)を試してみた

最後に音声合成です。POST /v1/t2a_v2にspeech-2.8-hdを指定し、日本語のナレーションを生成しました。ここでは音質そのものよりも、請求される文字数が入力した文字数と一致しないという、コスト試算に直結する発見がありました。
音声合成(TTS)の検証結果
まず利用できる声をPOST /v1/get_voiceで取得したところ、システムボイスは332件あり、そのうち日本語のボイスは15件でした。Japanese_IntellectualSenior(知的な年長者)やJapanese_GenerousIzakayaOwner(気前のいい居酒屋の店主)など、キャラクター性のある名前が並びます。
このうち前者を使い、数値を多く含む業務文(90文字)を読み上げさせました。
| 項目 | 実測値 |
|---|---|
| 入力文字数 | 90文字 |
| 所要時間 | 4.73秒 |
| 生成された音声 | 16.2秒 |
| ファイルサイズ | 約261KB |
実際に聴いてみたところ、日本語の発音と文章としての流暢さに問題はありませんでした。ナレーションとしてそのまま使える水準です。
気になった点は2つあります。ひとつは声質で、いわゆる「イケボ」に寄っており、ボイス名から想像する落ち着いた年長者の声とは少しずれます。
もうひとつが日付の数字のイントネーションで、「2026年9月15日」の読み上げに違和感が残りました。日付や金額を頻繁に読み上げる用途では、読み仮名の指定などの対策を検討してください。
請求される文字数は入力の約1.2〜1.3倍になる
レスポンスのextra_infoには、入力文字数を示すword_countと課金対象を示すusage_charactersが返ります。ところがこの2つは一致しません。性質の異なる文で比較しました。
| 入力した文の種類 | word_count | usage_characters | 倍率 |
|---|---|---|---|
| 数字・記号あり | 46 | 56 | 1.22 |
| 数字・記号なし | 42 | 53 | 1.26 |
| 英数字混在 | 36 | 44 | 1.22 |
| 90文字の業務文 | 90 | 113 | 1.26 |
当初は「数字が読み仮名に展開されるぶん増えるのだろう」と考えましたが、数字を一切含まない文でも倍率は変わりませんでした。原因は公式ドキュメントにも記載がありません。
実務上重要なのは理由よりも結果です。「1文字あたりの単価×原稿の文字数」で試算すると、実費は2割強も上振れします。speech-2.8-hdの単価は100万文字あたり100ドルのため、10万文字のナレーションなら10ドルではなく12〜13ドルで見積もってください。
ボイスクローンは3ステップ・約13秒で作成できる

MiniMaxには10秒程度の音声から話者を再現するRapid Voice Cloningがあります。他人の声を無断で複製することは重大な権利侵害にあたるため、素材には前項でspeech-2.8-hdに生成させた16.2秒の音声を使い、権利関係の問題が生じない条件で手順と所要時間だけを実測しました。
手順は3つのエンドポイントを順に呼び出す流れです。POST /v1/files/uploadにpurpose=voice_cloneで音声を送ってfile_idを受け取り、POST /v1/voice_cloneにそのfile_idと任意のvoice_idを渡します。あとはPOST /v1/t2a_v2のvoice_setting.voice_idに、付けた名前をそのまま指定するだけです。
POST /v1/files/uploadにpurpose=voice_cloneで音声を送り、file_idを受け取ります。
POST /v1/voice_cloneにfile_idと任意のvoice_idを渡します。
POST /v1/t2a_v2のvoice_setting.voice_idに、付けた名前を指定します。
| 手順 | HTTP | 所要時間 |
|---|---|---|
| 音声のアップロード(/v1/files/upload) | 200 | 3.55秒 |
| クローンの作成(/v1/voice_clone) | 200 | 4.98秒 |
| クローン音声での合成(/v1/t2a_v2) | 200 | 3.95秒 |
注目したいのは学習の待ち時間が発生しなかった点です。/v1/voice_cloneはジョブIDを返して完了を待たせる非同期方式ではなく、5秒弱で同期的に応答を返しました。3ステップの合計でも12.5秒で、そのまま合成に使えます。
作成後にPOST /v1/get_voiceへvoice_type=voice_cloningを指定すると、登録したvoice_idが一覧に現れます。声は再アップロードなしで何度でも呼び出せるため、ナレーターを固定したい用途では初回だけこの手順を通せば十分です。
クローン音声で71文字を読み上げさせたところ、usage_charactersは85文字でした。前項で見た1.2倍前後の上振れは、クローン音声でも同じように発生します。
コスト面では、Rapid Voice Cloningは1音声あたり1.5ドルです。公式の料金表には「クローン作成時ではなく、その声を初めて合成に使った時点で課金される」と明記されています。作成しただけでは課金されないため、声の登録を先に済ませておき、実際に使う段階で費用が発生する仕組みです。
※クローン作成そのものは無課金でも、初回合成の時点で1.5ドルが請求されます。試用する場合も費用が発生する前提で進めてください。
技術的なハードルは低い一方、運用上のリスクは別途残ります。導入を検討する際は、最低限、次の3点を社内で確認してから進めてください。
- 複製する声の本人から、用途と期間を明示した同意を取得しているか
- 生成した音声を第三者が「本人の発言」と誤認しない運用になっているか
- 退職や契約終了の際に、登録済みの声を削除する手順が定まっているか
MiniMax APIの料金体系

MiniMax APIの料金には、使ったぶんだけ支払う従量課金と、月額固定のToken Planの2種類があります。技術検証の段階なら、月額固定費のかからない従量課金を選べば問題ありません。
価格面では他社の主力モデルを大きく下回り、MiniMax-M3の入力単価は100万トークンあたり0.3ドルと、OpenAIのgpt-5.1の約4分の1に収まります。
従量課金プランの料金
従量課金の単価は公式の料金ページで公開されており、2026年9月時点では以下のとおりです。
| モデル | 単価 |
|---|---|
| MiniMax-M3(入力51万2,000トークン以下) | 入力 0.3ドル・出力 1.2ドル(100万トークンあたり/約45円・約180円) |
| MiniMax-H3(動画) | 768P 0.08ドル/秒、2K 0.13ドル/秒(約12円・約20円) |
| speech-2.8-hd(音声合成) | 100ドル(100万文字あたり/約1万5,000円) |
| image-01(画像) | 0.0035ドル/枚(約0.5円) |
なおM3の0.3ドルは、定価0.6ドルからの「永続50%オフ」が適用された価格です。公式は恒久的な割引と明記していますが、価格改定の可能性は残るでしょう。
従量課金に月額の最低利用料はなく、先に残高をチャージして消費する仕組みです。ここで最初の関門になるのが、残高が2系統に分かれている点です。コンソールには「Subscription」のクレジット残高と「Pay-as-you-go」の有効残高という、別々の財布が用意されています。
| 残高 | チャージ単位 | APIの引落元 |
|---|---|---|
| Subscription のクレジット | 5ドル・25ドル・100ドル(約750円・3,750円・1万5,000円) | 対象外 |
| Pay-as-you-go の有効残高 | 金額を自由入力(1回25ドル・約3,750円から) | こちら |
実際のコンソールでも、この2つは別々のページに分かれています。APIから使えるのは、次の「Balance」画面に表示される有効残高のほうです。

APIが引き落とすのはPay-as-you-go側だけです。Subscription側のクレジットは定額プランの割当を使い切った後に消費される性質のため、そちらに入金してもAPIは動きません。筆者は実際にこれを取り違え、支払いが成功しているのに残高不足のエラー(1008)が返る状態に陥りました。
「5ドルから試せる」と考えていると当てが外れるため、検証予算は25ドルから見ておいてください。
なおボイスクローンは1音声あたり1.5ドルの別料金がかかります。
Token Plan(定額制)の仕組み
Token Planは、月額固定で各APIを使える定額プランです。料金はPlusが月22ドル・Maxが月55ドル・Ultraが月132ドルの3段階で、テキスト・画像・音声のクォータが1つにまとまっているため、分野ごとに枠を買い分ける必要はありません(公式ドキュメント)。
ただし利用には専用のSubscription Keyを別途発行する必要があり、動画のH3とボイスクローンは対象外です。
またプランに含まれるトークン量は公式に公開されていません。実際の消費量が読めないため、いきなり定額に移行せず、従量課金で使用量を測ってから判断するのが安全です。
他社API(OpenAI・Claude・Gemini)との料金比較
主要な生成AI APIと並べると、MiniMaxの安さがはっきりします。OpenAI・Anthropic・Googleの各公式料金ページをもとに整理しました。
| モデル | 入力(100万トークン) | 出力(100万トークン) |
|---|---|---|
| MiniMax-M3 | 0.3ドル(約45円) | 1.2ドル(約180円) |
| Gemini 3.8 Flash | 0.75ドル(約113円) | 3.75ドル(約563円) |
| OpenAI gpt-5.1 | 1.25ドル(約188円) | 10ドル(約1,500円) |
| Claude Sonnet 5 | 2ドル(約300円) | 10ドル(約1,500円) |
※Gemini 3.8 Flashは2027年1月1日より入力1.5ドル・出力7.5ドルへの改定が公式に告知されています
出力単価で見ると、MiniMax-M3はOpenAIのgpt-5.1やClaude Sonnet 5の8分の1程度です。大量のテキストを扱うバッチ処理では、この差が月額数十万円規模の違いになることもあります。
ただし2026年9月時点では、OpenAIのgpt-5.6-luna(入力0.2ドル・出力1.2ドル)のように、M3と同水準の単価の軽量モデルも登場しています。また日本語の扱いや推論の精度は単価だけでは測れないため、用途ごとに実際の出力を比べて決めるのが確実です。
Claude APIとの比較検討をしたい方は、以下の記事もあわせてご覧ください。

MiniMax APIキーの取得方法と実装手順

MiniMax APIを使い始める流れは、アカウント登録・APIキーの発行・残高のチャージの3ステップで、所要時間は10分ほどです。
最初に押さえておきたいのが、MiniMaxには国際版と中国版の2つのプラットフォームがある点です。日本から使う場合は国際版(platform.minimax.io)を選びます。両者はアカウントもAPIキーもエンドポイントも別系統で、入口を間違えると認証エラーになります。
アカウント登録・APIキーの取得手順
登録からチャージまでの手順は次のとおりです。
- platform.minimax.ioでアカウントを作成する
- 左メニューの「Pay-as-you-go」から「Access」を開く
- 「Create new API Key」でキーに名前を付けて発行する
- 同じメニューの「Balance」で残高をチャージする
登録フォームでは連絡先メールアドレスと会社名(またはプロジェクト名)の入力が必須です。登録を終えて「Access」を開くと、最初はキーが1件もない状態から始まります。

「Create new API Key」を押すと、キー名を入力するモーダルが開きます。

キーの発行は、ここに名前を付けるだけで完了します。

注意したいのがキーの種類です。この画面には「This API Key works for pay-as-you-go billing and voice/video resource packs.」という赤字の注記があり、ここで発行したキーが使えるのは従量課金と音声・動画のリソースパックに限られます。定額のToken Planやクレジット残高を使う場合は、「Plan Details」から別途Subscription Keyを発行しなければなりません。
なお発行したキーは再表示できないので、その場で環境変数か.envに保存しておきましょう。
最後に「Balance」から残高をチャージします。金額は自由入力ですが、下限は25ドルです。

決済はStripe経由で、クレジットカードで完了します。2026年9月時点の実際の請求額は25.00ドル・4,025円(1ドル=161.00円のレート適用)でした。

※為替レートは決済時点のものが適用されるため、円建ての請求額は変動します。
Pythonでのリクエスト実装例
MiniMax APIはOpenAI APIと互換性のある形式に対応しており、公式ドキュメントでもOpenAI SDKからそのまま呼び出す方法が案内されています。
以下はPythonでテキスト生成を呼び出す最小限のコードです。
from openai import OpenAI
client = OpenAI(
base_url="https://api.minimax.io/v1",
api_key="<MINIMAX_API_KEY>",
)
response = client.chat.completions.create(
model="MiniMax-M3",
messages=[
{"role": "user", "content": "こんにちは"},
],
)
print(response.choices[0].message.content)MiniMax APIをOpenAI SDKから呼び出す最小限の実装例
変更点はbase_urlとmodelの2行だけです。既にOpenAI APIで動いているシステムなら、切り替えのコストはほぼかかりません。Anthropic SDK経由での呼び出しにも対応しています(ベースURLはhttps://api.minimax.io/anthropic)。
ただし互換性には穴もあり、presence_penalty・frequency_penalty・logit_biasなどのパラメータは非対応で、nは1しか指定できず、音声入力も使えません。
また動画生成だけは例外です。エンドポイントが/v2/video_generationに変わるうえ、処理も非同期になります。リクエストを送るとtask_idが返るので、状態を照会して完了後にダウンロードURLを受け取る流れです。
MiniMax API利用時の注意点

社外の生成AI APIへ業務データを送る以上、情報システム部門としては「そのデータがどこに保存され、学習に使われるのか」を説明できる状態にしておく必要があります。しかし海外事業者のAPIでは、この点を日本語の資料で確認しづらいのが実情です。
対応の考え方としては、規約で保証される範囲を先に押さえたうえで、送信前のマスキングとリクエスト・レスポンスのログ保全は自社側に持つのが基本です。監査を求められたときに、事業者側の仕様変更に左右されず経緯を示せます。
そこで利用規約とプライバシーポリシーの原文(いずれも2026年3月30日版)から論点を整理しました。
商用利用・データ取り扱いの注意点
押さえるべき点は5つです。
1. 運営はシンガポール法人で、データの保存先は米国
開発元は中国企業ですが、海外版APIの契約主体はシンガポール法人のNanonoble Pte Ltd.です。準拠法はシンガポール法、紛争解決はシンガポール国際仲裁センター(SIAC)の仲裁と定められています。
データの保存先は、プライバシーポリシーに「米国に所在するデータセンターに保存される」と明記されています。GDPR・EU-US Privacy Framework・標準契約条項(SCCs)への言及もあり、両文書に「China」「Chinese」という語は一度も登場しません。
2. 生成物の所有権はユーザーに留保される
利用規約には「入力および生成されたコンテンツについて、あなたが所有権を保持する」と明記されています。ただし「商用利用を許諾する」と明示した条文は存在しません。妨げる記述もありませんが、断定的な社内説明は避け、原文を添えて共有するのが安全です。
3. 「学習に使わない」とは書かれていない
プライバシーポリシーが否定しているのは「個人の特徴を推定すること」と「プロファイリングや広告ターゲティングを目的とした学習」に限られます。一方で利用規約はサービスの「開発・改善」への利用を認めており、これを拒否する手段は示されていません。機密データを送る運用は推奨できません。
4. データ保持期間の具体的な日数は書かれていない
「法令上必要または許容される期間」という基準が示されるのみで、何日保持するかの記載はありません。保持期間を社内規程で定めている企業は、事前に問い合わせてください。
5. AI生成であることの明示義務はユーザー側にある
利用規約は、ディープシンセシス技術に基づくサービスとして、ユーザー側に「非侵入型の識別子の付加」「ログ情報の保持」「生成物の目立つ位置への明示」を求めています。
あわせて、筆者が生成したファイルを解析したところ、mp4・mp3・jpgのいずれにもAIGCというメタデータが自動で埋め込まれていました。生成元の情報と改ざん検知用の電子署名が含まれるため、そのまま配布するとこの記録も一緒に渡ります。
ただし規約上の明示義務と、このメタデータの自動付与は別の話です。規約にAIGCやメタデータに関する記述はなく、あくまで筆者の実測にもとづく情報になります。
なおMiniMax-M3のオープンウェイト版のライセンスは独自の「MINIMAX COMMUNITY LICENSE」で、Apache 2.0やMITではありません。商用利用には「Built with MiniMax M3」の表示義務があります。
さらに年間売上2,000万ドルを超える企業は事前に書面での許諾を得る必要があり、それ以下の企業もMiniMaxへ一度限りの通知を行わなければなりません。
よくあるエラーと対処法
実装時につまずきやすいエラーを、公式のエラーコード一覧から整理しました。
| コード | 内容 | 主な原因と対処 |
|---|---|---|
| 1004 | not authorized | 国際版のキーを中国版のエンドポイントに送っている。ドメインを確認する |
| 2049 | invalid API Key | キーの文字列が誤っている。環境変数の読み込みを確認する |
| 1002 | rate limit | 上限を超過している。リトライ間隔を空ける |
| 1008 | insufficient balance | 残高不足。Pay-as-you-go側の残高をチャージする |
なかでも1004は国際版と中国版の取り違えで起きやすく、キー自体は正しいため原因に気づきにくいエラーです。
レート制限にも偏りがあります。公式のレート制限一覧によると、テキストのMiniMax-M3が毎分200リクエストなのに対し、画像生成のimage-01は毎分10リクエストです。画像をまとめて生成する処理を組むなら、キューを挟む設計が前提になるでしょう。
MiniMax APIの活用シーン

4分野を1つのAPIでまかなえる強みは、複数の形式を組み合わせるワークフローで効いてきます。文章を作り、画像を添え、ナレーションを載せるまでを一連の処理として書けるからです。加えて単価が低いぶん、試行回数を増やせるのも利点でしょう。
コンテンツ制作・多言語対応での活用
商品説明やマニュアルの制作では、原稿・図版・読み上げ音声をまとめて用意する場面が多くあります。MiniMax APIならこの工程を1つのスクリプトに収められます。
多言語展開との相性も良好です。音声合成が40言語に対応しているため、日本語の原稿から各国語のナレーションまで同じ仕組みで生成できます。社内研修の動画を10か国語で用意するようなケースでは、翻訳会社と収録スタジオに個別に依頼するより工数と費用を圧縮できます。
ただし検証結果のとおり、画像内に日本語のテキストを描かせることはできません。文字入りのバナーやサムネイルが必要な工程は、デザインツール側に残す前提で設計してください。
EC・カスタマーサポートでの活用
ECサイトで動画制作のネックになるのは、商品点数の多さです。1点ずつ撮影していては追いつきませんが、商品情報から紹介動画を生成する仕組みを作れば、新商品の追加と同時に動画を用意できます。
カスタマーサポートで活きるのは、100万トークンという文脈長です。過去の問い合わせ履歴やマニュアルをまとめて読ませたうえで回答を作れるため、参照範囲を絞り込む手間が減ります。音声合成と組み合わせれば、電話応対の一次受けまで同じAPIで構築できるでしょう。
実装を外部に相談したい方は、以下の記事もあわせてご覧ください。

生成AIのご相談はWEELへ!
MiniMax APIは、テキスト・動画・音声・画像の生成を1つのキーでまかなえる選択肢です。入力単価は100万トークンあたり0.3ドルと、主要な生成AI APIのなかでも低い水準にあります。OpenAI互換の形式に対応しているため、既存コードのbase_urlを差し替えるだけで試せます。まずは従量課金で小さく動かし、応答の質とコストを自社の用途で確かめてください。
「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、通勤時間に読めるメルマガを配信しています。
最新のAI情報を日本最速で受け取りたい方は、以下からご登録ください。
また、弊社紹介資料もご用意しておりますので、併せてご確認ください。

