【Gemini 3.6 Flash・3.5 Flash-Lite】トークン効率と低価格を両立したGoogleの最新AIモデルの性能・使い方を徹底解説

- Gemini 3.6 Flash・Gemini 3.5 Flash-Liteは、Googleが2026年7月22日に同時公開したFlashシリーズの最新AIモデル
- 3.6 Flashは前モデルから出力トークンを最大65%削減しながらコーディング・マルチモーダル性能が大幅に向上
- 3.5 Flash-Liteは毎秒350トークンの高速出力と100万トークンあたり入力0.30ドル・出力2.50ドルの圧倒的な低コストを実現
2026年7月22日、GoogleはGeminiシリーズの最新モデル「Gemini 3.6 Flash」と「Gemini 3.5 Flash-Lite」を同時に公開しました!
Gemini 3.6 Flashは「ワークホースモデル」として、コーディング・知識業務・マルチモーダルの性能向上と出力トークン最大65%削減を両立。一方のGemini 3.5 Flash-Liteは、毎秒350トークンの出力速度を誇る高スループット・低コストモデルで、エージェンティックなワークフローの大量処理に特化しています。
そこで本記事では、Gemini 3.6 FlashとGemini 3.5 Flash-Liteの概要から技術的な仕組み、ベンチマークスコア、料金体系、使い方、活用シーンまでを徹底的に解説していきます。ぜひ最後までご覧ください!
\生成AIを活用して業務プロセスを自動化/
Gemini 3.6 Flash・Gemini 3.5 Flash-Liteとは?

Gemini 3.6 FlashとGemini 3.5 Flash-Liteは、Google DeepMindが開発したGemini 3シリーズに属するFlashティアの最新モデルです。
Gemini 3.6 Flashは、Flashシリーズの主力モデルとして位置づけられています。テキスト・画像・音声・動画・コードといった複数のモダリティをネイティブに処理できる点はGemini 3.5 Flashを引き継ぎつつ、トークン効率の改善とエージェンティックなワークフローへの最適化が大きな進化ポイントです。Googleの公式ブログでは、開発者やユーザーのフィードバックを直接反映して設計されたモデルであることが強調されています。
Gemini 3.5 Flash-Liteは、3.5シリーズで最速・最低コストのモデルです。低レイテンシかつ高スループットが求められるタスクに最適化されており、エージェンティックな検索やドキュメント処理など、大量のリクエストを高速にさばく本番ワークロード向けに設計されています。
両モデルともコンテキストウィンドウは最大100万トークン(入力)、出力は最大64,000トークンに対応。ナレッジカットオフは2026年3月で、Computer Use(コンピュータ操作)がビルトインツールとして組み込まれています。
従来モデル「Gemini 3.5 Flash」について詳しく知りたい方は、以下の記事も参考にしてみてください。

Gemini 3.6 Flash・Gemini 3.5 Flash-Liteの仕組み

両モデルのアーキテクチャは、Gemini 3シリーズのTransformerベースモデルを基盤としています。
Gemini 3シリーズのFlashモデルは、入力トークンごとにモデルパラメータの一部だけを動的に活性化するスパースMixture of Experts(MoE)構造を採用しています。この仕組みによって、巨大なモデル容量を持ちながらも推論時の計算コストを抑え、高い知能と高速な推論を両立させています。
Gemini 3.6 Flashの仕組み
Gemini 3.6 Flashは、Gemini 3 Flashの推論基盤をベースに、「thinking level」パラメータを通じて推論の深さを動的に制御する仕組みを備えています。
簡単な質問応答には軽量な推論を、複雑なコード生成やエージェンティックタスクには深い推論を割り当てるといった柔軟な使い方が可能です。
Googleの公式資料によると、「より少ない推論ステップとツール呼び出しでマルチステップのワークフローを完了する」よう最適化されています。
Gemini 3.5 Flash-Liteの仕組み
Gemini 3.5 Flash-Liteも同様にthinking levelの制御に対応しており、用途に応じて低レイテンシ・低コストの実行から、より深い思考を必要とするサブエージェントのワークロードまで柔軟に切り替えられます。
3.5 Flash-LiteはGemini 3 Flashをベースとしており、前世代の3.1 Flash-LiteがGemini 3 Proベースだったのとは異なるアーキテクチャ基盤を持っています。
同時期に発表されたGeminiのモデルは下記で解説

Gemini 3.6 Flash・Gemini 3.5 Flash-Liteの特徴
両モデルの性能面における特徴を、それぞれのベンチマークスコアとともに整理します。
Gemini 3.6 Flashの性能


Gemini 3.6 Flashの最大の特徴は、性能向上とトークン効率改善を同時に達成した点です。
Artificial Analysis Indexで3.5 Flashと比較して出力トークン使用量が17%削減され、DeepSWEベンチマークでは最大65%の削減が確認されています。具体的には、DeepSWEでの1タスクあたりの平均出力トークンは、3.5 Flashの約27.6万トークンから3.6 Flashでは約9.7万トークンへと大幅に減少しています。
主要なベンチマークスコア(3.6 Flash vs 3.5 Flash)は以下のとおりです。
| ベンチマーク | 3.6 Flash | 3.5 Flash | 分野 |
|---|---|---|---|
| DeepSWE v1.1 | 49% | 37% | ソフトウェアエンジニアリング |
| MLE-Bench | 63.9% | 49.7% | ML研究 |
| OSWorld-Verified | 83.0% | 78.4% | コンピュータ操作 |
| GDPval-AA v2(Elo) | 1421 | 1349 | 知識業務 |

Gemini 3.5 Flash-Liteの性能


Gemini 3.5 Flash-Liteは、前世代の3.1 Flash-Liteから全面的にスコアが跳ね上がっているのが特徴です。特にエージェンティック・コーディングタスクでの伸びが際立っています。
| ベンチマーク | 3.5 Flash-Lite | 3.1 Flash-Lite | 分野 |
|---|---|---|---|
| Terminal-Bench 2.1 | 54% | 31% | ターミナルコーディング |
| GDPval-AA v2(Elo) | 1140 | 642 | 知識業務 |
| GDM-MRCR v2 | 72.2% | 60.1% | ロングコンテキスト |
| SWE-Bench Pro | 54.2% | — | エージェンティックコーディング |
| OSWorld-Verified | 74.0% | — | コンピュータ操作 |
X上で話題:3.5 Proの不在と「Flashだけで十分」論争
Gemini 3.6 FlashとGemini 3.5 Flash-Liteの発表に際して、X上では「Gemini 3.5 Proはどこに行った?」という声が多数上がっています。2026年2月にGemini 3.1 Proが公開されて以降、Googleのフラッグシップモデルは長らく更新されておらず、OpenAIやAnthropicが複数世代のアップデートをリリースする中で、Googleのフロンティアモデル不在が目立つ状況となっています。
Artificial Analysis Intelligence Indexでは、Googleが初めてトップ5圏外に落ちたとの指摘もあり、「Flashシリーズの効率改善だけで本当に競争力を保てるのか」という議論が白熱しています。
一方で、「Flashレベルでここまで性能が出るなら、Pro不要では」という意見も開発者の間で出ており、特にコスパ重視の本番ワークロードを扱う層からは好意的な反応が目立ちます。
Gemini 3.6 Flash・Gemini 3.5 Flash-Liteの安全性・制約
両モデルは、Googleのフロンティア安全性フレームワーク(Frontier Safety Framework)に基づく安全性評価を受けています。
Gemini 3.6 Flashでは、CBRN(化学・生物・放射線・核)およびサイバー攻撃の悪用に対するフロンティア安全性のセーフガードが拡充され、ジェイルブレイク攻撃への耐性が大幅に向上しています。同時に、正当な用途での不要な拒否(過剰拒否)を最小限に抑えるよう訓練されています。安全性スコアは3.5 Flashを上回る改善が見られ、トーン面でのわずかな後退が報告されていますが全体的な安全性には影響しないとのことです。
Gemini 3.6 Flash・Gemini 3.5 Flash-Liteの料金
両モデルの料金体系を、Gemini APIの公式料金ページに基づいて整理します。
Gemini 3.6 Flashの料金
3.6 Flashの出力料金は、前モデル3.5 Flashの9.00ドルから7.50ドルに約17%値下げされました。トークン効率の改善と合わせて、1タスクあたりの実質コストはさらに大きく下がっています。
| 項目 | 無料ティア | Standard有料ティア |
|---|---|---|
| 入力(100万トークンあたり) | 無料 | 1.50ドル |
| 出力(100万トークンあたり) | 無料 | 7.50ドル |
| コンテキストキャッシュ(入力) | 無料 | 0.15ドル |
| キャッシュストレージ | — | 1.00ドル / 100万トークン/時間 |
| バッチ / Flex処理(入力 / 出力) | — | 0.75ドル / 3.75ドル |
| Priority処理(入力 / 出力) | 無料 | 2.70ドル / 13.50ドル |
| Google検索グラウンディング | — | 月5,000プロンプト無料、以降14ドル / 1,000検索 |
Gemini 3.5 Flash-Liteの料金
3.5 Flash-Liteは入力0.30ドル・出力2.50ドルと、3.6 Flashの約3分の1の価格設定です。大量処理を前提としたエージェンティックワークロードにおいて、コスト面で圧倒的な優位性を持ちます。
| 項目 | 無料ティア | Standard有料ティア |
|---|---|---|
| 入力(100万トークンあたり) | 無料 | 0.30ドル |
| 出力(100万トークンあたり) | 無料 | 2.50ドル |
| コンテキストキャッシュ(入力) | — | 0.03ドル |
| キャッシュストレージ | — | 1.00ドル / 100万トークン/時間 |
| バッチ / Flex処理(入力 / 出力) | — | 0.15ドル / 1.25ドル |
| Priority処理(入力 / 出力) | 無料 | 0.54ドル / 4.50ドル |
| Google検索グラウンディング | — | 月5,000プロンプト無料、以降14ドル / 1,000検索 |
Gemini 3.6 Flash・Gemini 3.5 Flash-Liteのライセンス
両モデルはオープンソースではなく、GoogleのプロプライエタリモデルとしてクラウドAPI経由で提供されるSaaS形式のサービスです。
| 利用用途 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite | 備考 |
|---|---|---|---|
| 商用利用 | ⭕️ | ⭕️ | |
| 改変 | ❌️ | ❌️ | モデルの重み非公開 |
| 再配布 | ❌️ | ❌️ | API経由のみ利用可 |
| 特許使用 | – | – | 該当なし |
| 私的使用 | ⭕️ | ⭕️ |
Gemini 3.6 Flash・Gemini 3.5 Flash-Liteの使い方
両モデルには複数のアクセス方法があります。今回は代表的な3つの方法をご紹介します。
Google AI Studioからブラウザで試す
コードを書かずに、ブラウザ上ですぐに試せる最も手軽な方法です。
ブラウザで Google AI Studio を開き、Googleアカウントでログインします。初回利用時は、デフォルトのGoogle CloudプロジェクトとAPIキーが自動的に作成されます。
画面のモデル選択メニューから利用したいモデルを選びます。3.6 Flashは「Gemini 3.6 Flash」、Flash-Liteは「Gemini 3.5 Flash-Lite」を選択してください。

テキストボックスにプロンプトを入力して送信します。画像やPDFなどのファイルをアップロードしてマルチモーダルな入力を試すことも可能です。thinking levelの調整やツール設定も画面上から行えます。
結果に満足したら、画面右上の「Get code」ボタンをクリックすると、Python・JavaScript・curlなどの言語でAPI呼び出しコードをエクスポートできます。
Python(Gemini API)から利用する
プログラムに組み込む場合の標準的な方法です。Python 3.9以上が必要となります。
pip install -q -U google-genaiGoogle AI Studioの「Get API Key」からAPIキーを作成し、環境変数に設定します。
export GEMINI_API_KEY="your-api-key-here"import os
from google import genai
client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="エージェンティックAIの最新トレンドを、開発者向けに簡潔にまとめてください。"
)
print(response.text)モデルIDを変更するだけで、Flash-Liteも同じコードで利用できます。
response = client.models.generate_content(
model="gemini-3.5-flash-lite",
contents="以下のテキストを日本語に翻訳してください:The model is optimized for high-throughput agentic workflows."
)
print(response.text)大量のリクエストを処理する場合は、Flash-Liteの毎秒350トークンの出力速度と低価格が大きなアドバンテージになります。
Geminiアプリから利用する
一般ユーザー向けには、Geminiアプリから直接利用できます。Webブラウザまたはモバイルアプリでアクセスすると、3.6 Flashおよび3.5 Flash-Liteが利用可能です。

【業界別】Gemini 3.6 Flash・Gemini 3.5 Flash-Liteの活用シーン
2つのモデルは役割分担が明確になっています。ここからは、業界別にどちらのモデルが適しているかを含めて紹介します。
ソフトウェア開発・IT
3.6 FlashのDeepSWE 49%、MLE-Bench 63.9%という高いコーディング能力は、コードレビュー・バグ修正・コードマイグレーション・テストコード生成といった高度なタスクに適しています。「不要なコード編集が減少し、実行ループの回数が削減された」とGoogleが報告しており、コーディングエージェントのフィードバックループを大幅に短縮できるでしょう。
一方で3.5 Flash-Liteも、Terminal-Bench 2.1で54%を達成しており、分類・タグ付け・コード補完など比較的軽量なコーディングタスクを大量にさばく用途に向いています。マスターエージェントに3.6 Flash、サブエージェントに3.5 Flash-Liteというマルチエージェント構成も有力な選択肢です。
生成AIを搭載したSaaSについて、詳しく知りたい方は以下の記事も参考にしてみてください。

金融・法務
3.6 Flashは、Hebbiaによる評価で引用の多い財務調査資料からの証拠発見において最高性能を記録し、Harveyはドキュメントドラフト・レビューでタスク完了速度の平均12%向上を報告しています。 契約書分析・財務レポート作成・規制文書の要約など、精度が求められるドキュメント処理に適しています。
3.5 Flash-Liteは、領収書のOCR処理や大量の取引データの分類・仕分けなど、高スループットで回すバックエンド処理向きです。
金融業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

Eコマース・カスタマーサポート
3.5 Flash-Liteの低コストと高速性は、大量の商品データ処理・カスタマー問い合わせの分類・多言語翻訳といった高ボリュームな業務の自動化に最適です。公式デモでは、大規模なECデータセットから商品特徴を抽出・整理するワークフローが紹介されています。
生成AIをカスタマーサポートで活用する方法について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Gemini 3.6 Flash・Gemini 3.5 Flash-Liteが解決できること
続いて、2つのモデルが解決できる具体的な課題を整理していきましょう。
エージェンティック開発のコスト削減
3.6 Flashは同じタスクを最大65%少ないトークンで完了でき、3.5 Flash-Liteは100万トークンあたり0.30ドル/2.50ドルという低価格で大量のサブエージェントタスクを処理できます。両モデルを組み合わせることで、マルチエージェントシステムの運用コストを大幅に圧縮できるでしょう。
ドキュメント処理の自動化と高速化
100万トークンのコンテキストウィンドウにより、複数のPDFやスプレッドシートを一括で処理することができます。3.6 Flashは精度重視の分析に、3.5 Flash-Liteは大量のドキュメントを高速にさばく初期処理に、という役割分担が効果的でしょう。
コーディングエージェントの品質改善
3.6 Flashの「不要なコード編集の削減」と「実行ループの短縮」は、コーディングエージェントにありがちな反復修正の問題を軽減してくれるでしょう。DeepSWEスコアが37%から49%に向上したことが示すように、一発で正確なコードを出力する能力が強化されています。
Gemini 3.6 Flashを使ってみた
それでは実際にGemini 3.6 Flashを試してみましょう。GeminiのWebブラウザ版からそれぞれのモデルを選択して検証を行いました。
検証①:複雑なマルチステップ推論タスク
3.6 Flashのベンチマークで大きく向上した「知識業務」と「推論能力」の実力を確かめるため、複数のステップを踏む分析タスクを投げてみました。
プロンプトはこちら
あなたは経営コンサルタントです。以下の条件で、架空のスタートアップの事業計画を分析してください。
【会社概要】
- AIを活用した飲食店向けの需要予測SaaS
- 月額3万円のサブスクリプションモデル
- 現在の顧客数:50店舗、月次チャーンレート:5%
- 月間のマーケティング費用:100万円、CAC(顧客獲得コスト):10万円
この条件をもとに、以下を分析してください:
1. 現在のユニットエコノミクス(LTV/CAC比率)を計算し、健全かどうか評価
2. 12ヶ月後の想定MRR(月次経常収益)をシミュレーション
3. 損益分岐点に到達するために必要な改善施策を3つ提案
各項目について計算過程を明示し、日本語で出力してください。出力結果(一部抜粋)はこちら



検証②:1回のプロンプトで完結するWebアプリ生成
エージェンティックな開発能力のもう一つの見どころとして、「1回のリクエストで動くものが出てくるか」をテストしてみました。Geminiの「Canvas」機能を使い、コード生成をそのままプレビューできる形で試しています。
プロンプトはこちら
HTMLとJavaScriptだけで動くポモドーロタイマーアプリを作ってください。要件は以下のとおりです:
- 25分の作業タイマーと5分の休憩タイマーを切り替えられる
- スタート/一時停止/リセットボタン
- 残り時間のカウントダウン表示(mm:ss形式)
- タイマー終了時にブラウザ通知で知らせる
- 作業と休憩のセッション完了回数を記録・表示する
- ダークテーマのモダンなUIにする
全て1つのHTMLファイルにまとめてください。出力結果はこちら

よくある質問
最後に、Gemini 3.6 FlashとGemini 3.5 Flash-Liteに関して、多くの方が疑問に感じるポイントをQ&A形式でまとめました。
Gemini 3.6 Flash・Gemini 3.5 Flash-Liteでエージェンティック開発を加速しよう!
Gemini 3.6 FlashとGemini 3.5 Flash-Liteは、性能向上と効率改善の両立というエージェンティックAI時代の開発者が最も求めていた進化を体現したモデルです。3.6 Flashの出力トークン大幅削減と料金値下げ、3.5 Flash-Liteの圧倒的な速度と低コストにより、これまでコスト面がネックだったエージェンティックワークフローの本番運用がぐっと現実的になりました。
コーディング・知識業務・マルチモーダル処理のいずれにおいてもベンチマークスコアが向上しており、Google AI Studio・API・Geminiアプリのどこからでもすぐに使い始められる手軽さも魅力です。Gemini 3.5 Proの一般公開や次世代Gemini 4の開発も進行中とのことで、Googleの生成AIモデルの進化からますます目が離せません。
最後に
いかがだったでしょうか?
弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。
株式会社WEELは、自社・業務特化の効果が出るAIプロダクト開発が強みです!
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
まずは、「無料相談」にてご相談を承っておりますので、ご興味がある方はぜひご連絡ください。
➡︎生成AIを使った業務効率化、生成AIツールの開発について相談をしてみる。

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。
セミナー内容や料金については、ご相談ください。
また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。

