主要LLMのAPI料金比較!試算結果や選び方、コスト削減のテクニックを解説

- LLM APIの料金は入力・出力のトークン数に応じた従量課金が基本で、出力の単価は入力より高い
- 2026年9月時点では同じプロバイダー内でも上位モデルと軽量モデルで単価に数十倍の差がある
- バッチ処理・プロンプトキャッシング・モデルの使い分けを組み合わせると費用を大きく抑えられる
LLM APIは、ChatGPTやGeminiなどの生成AIを自社のシステムに組み込むための仕組みです。料金は使った分だけ払う形式が主流ですが、同じOpenAIでも入力単価に最大50倍の差があります。

とはいえ、「どのモデルが安いの?」「毎月いくらかかるの?」と悩む方も多いのではないでしょうか?
この記事では、主要LLM APIの料金比較や選び方、費用を抑えるコツを解説します。最後まで読めば、自社に合うモデルと予算の目安がわかるはずです。
\生成AIを活用して業務プロセスを自動化/
LLM APIとは
LLM APIとは、大規模言語モデル(LLM)を外部のプログラムから呼び出して使うための窓口です。自社のアプリや社内システムから文章を送ると、生成AIが作った回答が返ってきます。
ChatGPTの画面で対話するのとは違い、自社サービスや業務フローに生成AIの機能を組み込めるのが大きな特徴です。問い合わせ対応の自動化や社内文書の要約など、企業が生成AIを本格的に活用する際の入口と言えるでしょう。
料金はやり取りした文章量に応じて決まるのが一般的で、その計算の基本単位となるのが「トークン」と呼ばれるものです。まずはトークンの考え方から押さえておきましょう。
LLM APIのトークンとは

トークンとは、生成AIが文章を処理するときの最小単位です。単語や数字、句読点などが1トークンとして数えられ、この数をもとに料金が計算されます。
LLM APIでは、送った文章(入力)と返ってきた文章(出力)を別々に数えて課金するのが一般的です。さらに出力トークンの単価は入力よりも高く設定されていることが多く、長い回答を生成させるほど費用はかさみます。
また、注意したいのが、同じ文章でもモデルによってトークン数が変わる点です。Anthropicは、Claude Sonnet 5で新しい分割方式を採用した結果、同じ入力でも従来の1.0〜1.35倍ほどのトークン数になると説明しています。
主な課金モデル(従量課金・プロビジョンド・サブスク)
| 課金モデル | 仕組み | 向いているケース |
|---|---|---|
| 従量課金(Pay-as-you-go) | 使ったトークン量に応じて支払う | 試験導入や、月ごとの利用料が変動する用途 |
| プロビジョンドスループット | 一定の処理能力を事前に確保して支払う | 大量の処理を安定して回したい本番運用 |
| 月額固定(サブスク) | 月額料金で決められた範囲まで利用できる | 社員が画面上で生成AIを使う社内利用 |
主要プロバイダーの開発者向けAPIは、従量課金が基本です。大規模に利用する企業向けには、処理能力をあらかじめ確保するプロビジョンドスループットも用意されているため、覚えておくとよいでしょう。
例えばGoogleは、Gemini APIのエンタープライズ向けプランの選択肢としてプロビジョンドスループットを挙げています。一方、月額固定はChatGPTやClaudeのような画面で使うプラン契約が中心で、API利用とは別物と考えておくとよいでしょう。
なお、APIの基本的な仕組みや生成AIでの活用方法について詳しく知りたい方は、下記の記事を併せてご確認ください。

【最新】主要LLM API料金比較一覧表

2026年9月時点の主要LLM APIの料金を、プロバイダーとモデルの階層ごとに一覧にまとめました。いずれも100万トークンあたりの標準料金(米ドル)です。
| プロバイダー | モデル | 位置づけ | 入力 | 出力 |
|---|---|---|---|---|
| OpenAI | GPT-6 Astra | 最上位 | $10.00 | $50.00 |
| OpenAI | GPT-5.6 Sol | フラッグシップ | $4.00(期間限定価格) | $20.00(期間限定価格) |
| OpenAI | GPT-5.6 Terra | 中位 | $2.00 | $12.00 |
| OpenAI | GPT-5.6 Luna | 軽量 | $0.20 | $1.20 |
| Gemini 3.1 Pro Preview | フラッグシップ | $2.00 | $12.00 | |
| Gemini 3.8 Flash | 中位 | $0.75(2026年12月末まで) | $3.75(2026年12月末まで) | |
| Gemini 3.5 Flash-Lite | 軽量 | $0.30 | $2.50 | |
| Anthropic | Claude Fable 5.1 | 最上位 | $10.00 | $50.00 |
| Anthropic | Claude Opus 5 | フラッグシップ | $5.00 | $25.00 |
| Anthropic | Claude Sonnet 5 | 中位 | $2.00 | $10.00 |
| Anthropic | Claude Haiku 4.5 | 軽量 | $1.00 | $5.00 |
| DeepSeek | DeepSeek V4.1 Flash | 標準 | $0.30(ピーク時) | $1.20(ピーク時) |
| xAI | Grok 4.6 | フラッグシップ | $2.00 | $6.00 |
表を見ると、同じフラッグシップ同士でも単価に数倍の開きがあることがわかります。ただし、安いモデルが自社の用途で十分な品質を出せるかは別問題で、料金は性能とセットで比較することが大切です。
OpenAI(GPTシリーズ)
OpenAIは、2026年9月時点でGPT-6 AstraとGPT-5.6シリーズ(Sol・Terra・Luna)を主力モデルとして公開しています。
OpenAIの公式料金ページによると、入力100万トークンあたりの料金は最上位のAstraが10ドル、軽量なLunaが0.20ドル。同じOpenAI内でも50倍の差があるため、用途に合わせた使い分けが欠かせません。
また、長い文章を入力すると単価が上がる「長文料金」が設定されている点も要注意。特定地域でデータを処理するオプションを選ぶと、対象モデルは料金が10%上乗せされます。
Google(Geminiシリーズ)
Googleは、上位のGemini 3.1 Pro Previewに加え、バランス型のFlash系と低価格なFlash-Lite系をそろえています。
Gemini APIの公式料金ページによると、Gemini 3.1 Pro Previewは入力2ドル・出力12ドル。他社のフラッグシップと比べて比較的手ごろな価格帯に位置しています。ただし、20万トークンを超える長い入力では入力4ドル・出力18ドルに上がる仕組みです。
最新のGemini 3.8 Flashは、2026年12月31日まで入力0.75ドル・出力3.75ドルの期間限定価格になっています。
Anthropic(Claudeシリーズ)
Anthropicは、Claude Fable 5.1・Opus 5・Sonnet 5・Haiku 4.5の4モデルを最新ラインアップとして公開しています。
Claudeの公式料金ページによると、最上位のFable 5.1は入力10ドル・出力50ドル、Opus 5は入力5ドル・出力25ドル。
中位のSonnet 5は入力2ドル・出力10ドルです。Sonnet 5の料金は当初導入記念価格とされていましたが、2026年8月に正式な標準価格として据え置かれました。
最も手ごろなHaiku 4.5は、入力1ドル・出力5ドル。全モデルでバッチ処理を使うと料金が50%オフになるほか、米国内だけで処理するオプションも1.1倍の料金で選択できます。
その他プロバイダー(DeepSeek・Grokなど)
主要3社以外にも、コストパフォーマンスに優れたLLM APIが登場しています。
中国のDeepSeekは、公式ドキュメントでDeepSeek V4.1 Flashの料金を入力0.30ドル・出力1.20ドルと案内しています。時間帯によって料金が変わる仕組みで、混雑しない時間帯は半額になるのが大きな特徴。
Grokシリーズの最新モデルであるGrok 4.6は、公式サイトで入力2ドル・出力6ドルとされています。出力単価が比較的低いため、長い回答を生成する用途では候補になるでしょう。
ただし、海外事業者のAPIを使う際は、データの取り扱いや利用規約を事前に確認しておく必要があります。
LLM APIの選び方
LLM APIを料金の安さだけで選ぶと、「回答の質が足りず作り直しになる」「処理が遅くて現場で使われない」といった失敗につながりがちです。単価が安くても、やり直しが増えれば結果的に費用はかさむことになってしまいます。
選定時は、料金に加えて性能・扱える文章量・応答速度・セキュリティの4つの軸で比べるのがおすすめです。ここからは、それぞれのポイントを解説します。
性能・精度
求められる性能は、用途によって大きく変わります。問い合わせの分類や定型文の作成であれば、軽量モデルでも十分に対応できるケースが多いでしょう。
一方、契約書のチェックや複雑なプログラム開発など、判断ミスが許されない業務では上位モデルが安心です。いきなり1つに絞らず、実際の業務データで複数のモデルを試しながら、品質と料金のバランスを確かめてみてください。
公開されている性能評価の点数は参考程度にとどめ、自社の業務で使えるかどうかを基準に判断するのが失敗しないコツです。
コンテキストウィンドウの長さ
コンテキストウィンドウとは、1回のやり取りでモデルが扱える文章量の上限のことです。長いマニュアルや大量の社内文書を読み込ませたい場合は、この上限が十分に大きいモデルを選ぶ必要があります。
例えばDeepSeekは、公式ドキュメントでAPIのコンテキスト長を100万トークンと案内しています。ただし、Gemini 3.1 Pro Previewのように一定の長さを超えると単価が上がるモデルもあるため、長文を扱う用途では料金体系も併せて確認しましょう。
レスポンス速度(レイテンシ)
レイテンシとは、リクエストを送ってから回答が返ってくるまでの待ち時間です。チャットボットや接客対応など、利用者がその場で回答を待つ用途では応答の速さが満足度に直結します。
一般的には、軽量モデルほど応答が速い傾向。また、OpenAIやAnthropicは料金を上乗せして処理を速める「Fast mode」を用意しています。速度と費用は両立しにくいため、業務に必要な速さを見極めることが大切です。
セキュリティ・ログ管理要件
重要文書や機密情報を扱う場合、セキュリティ要件の確認は欠かせません。特に、社外のLLM APIを使う際にアクセスログの取得・保管といった社内規則とどう両立させるかは、多くの企業がつまずきやすいポイントです。
確認したいのは、入力データが学習に使われるかどうか、どの地域で処理されるか、ログをどこまで残せるかの3点。例えばGoogleは、Gemini APIの無料枠では入力内容をサービス改善に使う一方、有料枠では使わないと明記しています。
自社のルールに照らして使えるサービスを判断しきれない場合は、専門家に相談するのも一つの方法でしょう。
なお、生成AIの導入を何から進めればよいか迷っている方は、下記の記事を併せてご確認ください。

【実践】自社ユースケース別にLLM APIコストを試算
料金表を眺めているだけでは、「結局うちの場合は月いくら?」という疑問はなかなか解消されません。100万トークンあたりの単価は、実際の業務量に置き換えて初めて意味を持つからです。
ここでは、月間の処理件数とトークン数から概算コストを出す方法と、企業からの相談が多いユースケースの試算例を紹介します。
試算の基本ステップ(処理量×トークン単価)

LLM APIの月額費用は、以下の計算式でおおよその金額を出せます。
月額費用 = 月間処理件数 ×(1件あたりの入力トークン数 × 入力単価 + 1件あたりの出力トークン数 × 出力単価)÷ 100万
まずは、1件あたりの入力と出力がどのくらいの長さになるのかを把握しましょう。実際の業務データを数件APIで処理すれば、利用したトークン数から目安がつかめます。
ポイントは、出力トークンの見積もりを甘くしないこと。出力の単価は入力より高いため、回答の長さが費用を大きく左右するのです。
ユースケース別の月間コスト試算例
企業からの相談で特に多い「問い合わせ対応」「議事録などの要約」「翻訳」の3つについて、モデル別の月間コストを試算しました。前提条件は一般的な利用を想定した仮の数値のため、自社の条件に置き換えて計算してみてください。
| ユースケース | 前提条件 | GPT-5.6 Luna | Gemini 3.8 Flash | Claude Sonnet 5 | Claude Opus 5 |
|---|---|---|---|---|---|
| 問い合わせ対応 | 月1万件/入力2,000・出力500トークン | 約$10 | 約$34 | 約$90 | 約$225 |
| 議事録の要約 | 月200件/入力2万・出力1,000トークン | 約$1 | 約$4 | 約$10 | 約$25 |
| 翻訳 | 月1,000件/入力3,000・出力3,000トークン | 約$4 | 約$14 | 約$36 | 約$90 |
上記は標準料金だけで計算した目安です。モデルによっては回答前の思考に使ったトークンも出力として課金されるため、実際の費用は試算より上振れする可能性があります。
なお、LLM APIを組み込んだシステムの開発費用について知りたい方は、下記の記事を併せてご確認ください。

問い合わせ対応
問い合わせ対応では、FAQや回答ルールを毎回読み込ませるため入力が長くなりがちです。月1万件の場合、軽量なGPT-5.6 Lunaなら月10ドル前後、Claude Sonnet 5でも90ドルほどに収まる計算になります。
毎回共通のFAQ部分をキャッシュすれば、入力コストをさらに圧縮できるでしょう。
要約
議事録の要約は、入力が長く出力が短い典型的なパターンです。1時間程度の会議を月200件要約する想定なら、上位のOpus 5を使っても月25ドルほどです。
処理件数がそれほど多くない業務では、あえて上位モデルを選んで品質を優先するという判断も十分に成り立ちます。
翻訳
翻訳は入力と出力がほぼ同じ長さになるため、出力単価の影響を強く受けるのが特徴です。同じ条件でも、Opus 5では月90ドル、GPT-5.6 Lunaなら4ドル台と大きな差があります。
社外に出す契約書や広告文は上位モデル、社内向けの資料は軽量モデルといった具合に、文書の重要度で使い分けるのがおすすめです。
LLM APIのコストを削減するテクニック

LLM APIの費用は、使い方を少し工夫するだけで大きく変わります。同じ処理量でも、設定次第で料金を半分以下に抑えられるケースも珍しくありません。
ここでは、すぐに取り入れやすい3つのテクニックを紹介します。
プロンプトキャッシングで削減
プロンプトキャッシングとは、毎回送る共通部分(指示文やマニュアルなど)を一時的に保存し、2回目以降は割安な料金で読み込む仕組みです。
例えばClaude Sonnet 5の場合、通常の入力は100万トークンあたり2ドルですが、キャッシュからの読み込みは0.20ドルと10分の1。OpenAIのGPT-5.6シリーズも、キャッシュ済みの入力は通常の10分の1の単価に設定されています。
バッチAPIの活用
バッチAPIは、すぐに回答が必要ない処理をまとめて依頼し、時間をかけて処理してもらう仕組みです。OpenAI・Google・Anthropicの主要3社はいずれも、バッチ処理で料金を50%割り引いています。
夜間のデータ分類や過去文書の一括要約など、リアルタイム性が不要な業務には最適です。反対に、チャットボットのような即時の応答が必要な用途には向きません。まずは社内の処理を「すぐ必要なもの」と「後でよいもの」に仕分けるところから始めてみてください。
適切なモデル階層の使い分け
全ての処理に最上位モデルを使うと、費用はすぐに膨らんでしまうでしょう。簡単な作業は計量モデル、難しい判断だけ上位モデルという使い分けが、コスト削減の基本です。
例えば、問い合わせの内容をまず軽量モデルで分類し、複雑な質問だけを上位モデルに回すといった設計が考えられます。先ほどの問い合わせ対応の試算でも、モデルを変えるだけで費用に20倍以上の差が出ていました。
処理ごとに求める品質を決めておけば、モデルの割り当てもスムーズに進むはずです。
なお、生成AIの活用全般でコストを抑える方法を知りたい方は、下記の記事を併せてご確認ください。

API従量課金とプラン契約(サブスク)どちらを選ぶべきか
生成AIの料金体系には、開発者向けのAPI従量課金と、ChatGPTやClaudeのような月額のプラン契約の2種類があります。
APIは使った分だけ支払う仕組みで、主に自社システムへの組み込みに使うものです。一方、プラン契約は月額料金を払ってブラウザやアプリの画面から生成AIを使うサービスです。どちらが適しているかは、使い方によって変わります。
従量課金が向いているケース
自社サービスへの生成AI組み込みや業務システムとの連携など、開発を伴う用途では従量課金が基本になります。システムから自動で生成AIを呼び出すには、APIの利用が前提となるためです。
また、利用量が月によって大きく変わる場合も従量課金向きです。使わない月は費用がほとんどかからず、処理量が増えたときも柔軟に拡大できます。
ただし、利用量に比例して費用も増えるため、利用額の上限を設定するなど使いすぎを防ぐ仕組みを用意しておくと安心でしょう。
プラン契約が向いているケース
社員が日常業務で生成AIを使う場合や、非エンジニアの利用が中心の場合は、プラン契約が向いています。月額料金が決まっているため、毎月の費用を予測しやすいのが大きな利点です。
例えばClaudeのTeamプランは、年払いなら1人あたり月20ドルから利用可能。シングルサインオンなどの管理機能も含まれるため、社内展開しやすいでしょう。
まずは少人数でプラン契約を試し、自動化したい定型業務が見えてきた段階でAPI導入を検討する流れもおすすめです。
LLM APIのご相談はWEELへ!
LLM APIの料金は、入力と出力のトークン数に応じた従量課金が基本です。ただし、料金の安さだけで選ぶのは禁物です。性能や扱える文章量、応答速度、セキュリティを踏まえ、自社の業務データで試算と検証を行うことが大切です。プロンプトキャッシングやバッチAPI、モデルの使い分けを組み合わせれば、コストはさらに抑えられるでしょう。
LLM APIの選定や料金プランの比較、コスト試算でお悩みの方は、無料相談で自社の利用量に合ったモデル選びと費用を抑える進め方について、お気軽にご相談ください。
「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。
セミナー内容や料金については、ご相談ください。
また、サービス紹介資料もご用意しておりますので、併せてご確認ください。

