【Agentic Video Understanding】動画解析の常識が変わる!Geminiのトークン消費88%削減を実現するAI動画理解機能を徹底解説

- Googleが2026年9月2日に公開した、Geminiのエージェント型動画解析機能
- トークン消費量を最大88%削減しつつ、精度を最大7%向上させる
- Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Liteの3モデルで利用可能、追加料金なし
Agentic Video Understandingは、Googleが2026年9月2日に公開したGeminiモデル向けの新しい動画解析機能です。
従来の動画解析では、1秒に1フレームという固定レートで全フレームを読み込む「静的処理」が主流で、長尺の動画になるほどトークンが膨大になり、コストが跳ね上がるという課題がありました。
Agentic Video Understandingはこの問題を根本から解決し、トークン消費を最大88%削減、コストを最大66%カット、さらに精度を最大7%向上させるという驚異的な結果を叩き出しています。
とはいえ、「具体的にどういう仕組みなの?」「実際にどうやって使うの?」と気になっている方も多いのではないでしょうか。
この記事では、Agentic Video Understandingの概要・仕組み・料金体系・使い方から、業界別の活用シーンまでを徹底解説します。ぜひ最後までご覧ください!
\生成AIを活用して業務プロセスを自動化/
Agentic Video Understandingとは?

Agentic Video Understandingは、Google DeepMindが開発したGeminiモデル向けのエージェント型動画解析機能です。対応モデルはGemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Liteの3つで、Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformから利用できます。
従来のGeminiによる動画処理は「静的処理(Static Processing)」と呼ばれる方式で、デフォルトでは1秒あたり1フレーム(1 FPS)の固定レートで動画を読み込んでいました。短い動画であれば問題ありませんが、10分のハウツー動画や90分の講義、さらには数時間におよぶ録画ともなると消費トークン数が爆発的に増加します。
かといってフレームレートを下げると重要な場面を取りこぼすリスクがあり、開発者は「コストか精度か」の二択を迫られていたわけです。
Agentic Video Understandingの仕組み

Agentic Video Understandingの内部構造は、Geminiのコア推論能力とネイティブ動画ツールを組み合わせたエージェンティックループで構成されています。
具体的な処理フローは次のとおりです。まず、ユーザーから「動画+プロンプト(質問)」が入力されると、Geminiは「Think(思考)」フェーズに入ります。ここでモデルは質問の内容を分析し、回答に必要な情報がどこにありそうかを推論します。
次に、Geminiは内部ツールを呼び出して動画の必要な部分だけを取得します。Googleの公式図解によると、呼び出せるツールは「get_transcript(文字起こし取得)」「get_frames(start, end, fps)(指定区間のフレーム取得)」「get_audio(start, end)(指定区間の音声取得)」の3種類です。
ツールから返ってきた情報(映像フレーム、音声、文字起こし)をもとに「Observation(観察)」を行い、まだ情報が足りなければ再びThinkフェーズに戻って追加のツール呼び出しを実行します。このループを必要な回数だけ繰り返し、十分な根拠が集まった時点で最終的な回答を生成する仕組みです。
Agentic Video Understandingの特徴
Agentic Video Understandingの性能面での特徴を、公式ベンチマーク結果をもとに整理しておきましょう。

Googleが公開したベンチマークデータによると、標準的な動画解析ベンチマークにおいて、Agentic Video Understandingを有効化したGeminiモデルは、静的処理と比較してトークン消費量を最大88%削減、解析コストを最大66%カット、精度を最大7%向上させています。

特にGemini 3.7 Flashでの効果が顕著です。Googleは公式ブログで、Agentic Video Understandingを搭載したGemini 3.7 Flashが「テスト対象モデルの中で精度とコスト効率のバランスが最も高い、パレートフロンティアに位置する」と明言しています。これは、GPT 5.6やClaude Opus 5.0、Grokといった競合モデルと比較しても、コストあたりの精度で最上位に位置することを意味しています。
Agentic Video Understandingの安全性・制約
Agentic Video Understandingには、いくつかの制約があります。
まず、対応モデルがGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの3つに限定されている点です。Gemini 3.1 ProなどのProティアモデルでは利用できません。また、5分未満の短い動画では、内部の推論やツール呼び出しのラウンドトリップにより、静的処理と比べてTime to First Token(TTFT)がやや長くなる可能性があるとGoogleは説明しています。
動画ソースとしては、アップロード動画とYouTube URLの両方に対応していますが、YouTubeについては公開動画のみが対象で、限定公開や非公開の動画は利用できません。無料ティアではYouTube動画のアップロード量が1日あたり8時間に制限されています。
Agentic Video Understandingの料金
Agentic Video Understandingの料金は、通常のGemini APIトークン料金がそのまま適用されます。追加の機能料金は一切発生しません。
むしろ、Agenticモードではモデルが必要なフレームや音声だけを読み込むため、実際に消費するトークン数が静的処理より大幅に少なくなります。Googleの公式ベンチマークでは、長尺動画のケースでトークン消費が最大88%削減されています。つまり、機能として高性能化しているのに、実質コストは下がるという嬉しい構造です。
| モデル | 入力(100万トークンあたり) | 出力(100万トークンあたり) | キャッシュ入力 | 備考 |
|---|---|---|---|---|
| Gemini 3.7 Flash | 0.75ドル(2026年12月31日まで) | 3.75ドル(2026年12月31日まで) | 0.075ドル | 2027年1月1日以降は倍額 |
| Gemini 3.6 Flash | 0.75ドル(2026年12月31日まで) | 3.75ドル(2026年12月31日まで) | 0.075ドル | 2027年1月1日以降は倍額 |
| Gemini 3.5 Flash-Lite | 0.30ドル | 2.50ドル | 0.03ドル | 最も低コストのモデル |
Agentic Video Understandingのライセンス
Agentic Video UnderstandingはGeminiモデルの一機能として提供されるため、Googleのプロプライエタリサービス(クラウドAPI経由のSaaS)としての利用規約が適用されます。
オープンソースライセンス(Apache 2.0やMITなど)ではないため、モデル自体のダウンロードやローカル実行、改変・再配布などは行えません。あくまでAPIを通じて利用する形態となっています。
| 利用用途 | 可否 | 備考 |
|---|---|---|
| 商用利用 | ⭕️ | 有料ティアでのAPI利用 |
| 改変 | ❌ | モデル非公開のため不可 |
| 再配布 | ❌ | モデル非公開のため不可 |
| 特許使用 | – | |
| 私的利用 | ⭕️ |
Agentic Video Understandingの使い方
Agentic Video Understandingは、APIの設定で動画処理モードを「AGENTIC」に指定するだけで有効化できます。今回は代表的な2つの方法をステップ・バイ・ステップでご紹介します。
Google AI Studioからブラウザで試す
もっとも手軽にAgentic Video Understandingを試す方法です。
モデルを選択
画面のモデル選択メニューから「Gemini 3.7 Flash」「Gemini 3.6 Flash」「Gemini 3.5 Flash-Lite」のいずれかを選択します。

動画をアップロードしてプロンプトを入力
動画ファイルをアップロードするか、YouTubeのURLを入力し、質問を記述して送信します。Agentic Video UnderstandingはGoogle AI Studioで利用可能と公式が明言していますが、処理モードの指定方法はAPIから利用する場合のほうが明確です。
Python(Gemini API / GenerateContent)から利用する
開発者がプログラムに組み込む場合の標準的な方法です。Python 3.9以上が必要です。
SDKをインストール
pip install -U google-genaiAPIキーを取得
Google AI Studioの「Get API Key」からAPIキーを作成し、環境変数に設定します。
export GEMINI_API_KEY="your-api-key-here"動画をアップロードしてAgenticモードで解析する
以下のPythonコードで、動画ファイルをアップロードし、Agenticモードでの動画解析を実行できます。ポイントはmedia_processing="AGENTIC"の指定です。
import time
from google import genai
from google.genai import types
client = genai.Client()
# 動画ファイルをアップロード
video_file = client.files.upload(file="path/to/lecture.mp4")
# アップロード完了を待機
while video_file.state.name == "PROCESSING":
time.sleep(2)
video_file = client.files.get(name=video_file.name)
# Agenticモードで動画解析を実行
response = client.models.generate_content(
model="gemini-3.7-flash",
contents=[
types.Part.from_uri(
file_uri=video_file.uri,
mime_type=video_file.mime_type,
media_processing="AGENTIC", # ここでAgenticモードを指定
),
"この動画で提示されている3つの主要な論点は何ですか?",
],
)
print(response.text)YouTube動画のURLで直接解析する
YouTube動画を対象にする場合は、動画URLを直接指定できます。
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents=types.Content(
parts=[
types.Part(
file_data=types.FileData(
file_uri="https://www.youtube.com/watch?v=XXXXX"
),
media_processing="AGENTIC",
),
types.Part(text="この動画の重要なポイントを3文で要約してください。"),
]
),
)
print(response.text)【業界別】Agentic Video Understandingの活用シーン
Agentic Video Understandingは、動画データを扱うあらゆる業界に応用可能です。ここからは、業界別の活用シーンを紹介します。
メディア・動画制作
映像制作の現場では、大量の素材映像から必要なシーンを探し出す作業に膨大な時間がかかっています。Agentic Video Understandingの1秒未満の瞬間検索機能を活用すれば、カット境界の特定や特定のアクションが映っているタイムスタンプの自動検出が可能です。
実際に、早期アクセスパートナーのPonder社は「自社で構築したエージェント型動画解析パイプラインと同等のリコール率を、単一のAPI呼び出しで達成し、入力トークンを約3.5分の1に削減できた」と報告しています。
広告業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

教育・eラーニング
90分の講義動画や数時間の研修動画から特定のトピックだけを効率的に検索し、質問に回答する用途に適しています。学生や受講者が「この講義の中で微分方程式について説明している箇所はどこ?」と聞けば、Geminiが自律的に該当箇所を探し出して回答してくれます。
教育業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

スポーツ・エンターテインメント
試合映像やハイライトから特定のプレイを検索したり、選手の動作回数を正確にカウントしたりする用途が考えられます。Googleの公式デモでも、拍手の回数を高速動画から正確にカウントする事例が紹介されています。
エンタメ業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。
【課題別】Agentic Video Understandingが解決できること
続いては、Agentic Video Understandingがどのような課題の解決に向いているかを課題別に整理していきましょう。
長尺動画のトークンコスト爆発を防ぐ
従来の静的処理では、60分の動画を解析すると約36万トークン(デフォルト解像度)を消費していました。Agenticモードに切り替えることで、モデルが質問に必要な箇所だけを取得するため、同じ動画でもトークン消費量を最大88%削減できます。
長時間の会議録画やウェビナーを日常的に解析する業務では、月間のAPI利用コストに大きな差が生まれるでしょう。
高速な動きの見落としを解消する
1 FPSの静的処理では、拍手や指のスナップのような一瞬の動作は物理的にフレームに映らない可能性があります。Agenticモードでは、モデルが必要に応じてフレームレートを動的に上げて再確認するため、高速アクションの正確な検出・カウントが可能になります。
数時間の動画から特定の一言を見つけ出す
数時間におよぶ録画の中から特定の発言やシーンを探す「Needle-in-a-haystack」型の検索は、従来の方法では動画全体をコンテキストに読み込む必要があり非常に高コストでした。Agenticモードならば、モデルが文字起こしを先にスキャンし、関連する区間だけをピンポイントで読み込むことで、トークン効率を保ちながら正確な回答を生成します。
Agentic Video Understandingを使ってみた
それでは実際に、Agentic Video Understandingを使ってみましょう。
今回は、Google公式のKeynote動画をAgentic Video Understandingで要約してみます。以下のコードを実行します。
コードはこちら
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents=types.Content(
parts=[
types.Part(
file_data=types.FileData(
file_uri="https://www.youtube.com/watch?v=7Z5Vy9JBANs"
),
media_processing="AGENTIC",
),
types.Part(text="この基調講演で発表された最も重要な3つの内容を教えてください。日本語で回答してください。"),
]
),
)
print(response.text)出力結果はこちら

実行すると、レスポンスにtool_callやtool_responseが含まれていることが確認でき、モデルが動画内を自律的に探索した痕跡が見てとれます。出力結果では、UIリニューアル・Gemini Omni・エージェント機能という3つの主要アップデートを正確に抽出しており、長尺のKeynote動画から要点を的確に拾い上げる能力の高さがうかがえました。
今回のような、長尺のKeynote動画でもトークン消費が大幅に抑えられ、回答の精度も向上しているのが確認できました。特に、動画の途中に挿入された短いデモやスライドの切り替わりなど、静的処理では取りこぼしやすい情報も的確にキャッチしてくれた点が印象的でした。
よくある質問
Agentic Video Understandingで動画解析の効率を劇的に改善しよう!
Agentic Video Understandingは、動画解析における「コストか精度か」という従来のトレードオフを打ち破る画期的な機能です。トークン消費を最大88%削減しつつ精度を向上させるという成果は、長尺動画を日常的に扱う開発者やビジネスユーザーにとって非常に大きなインパクトがあります。
APIの設定を1行変えるだけで利用開始でき、追加料金もかからないため、動画を扱うプロジェクトがある方は、まずはGoogle AI Studioで試してみてはいかがでしょうか。今後、GeminiアプリやYouTubeの「Ask YouTube」機能への展開も予定されており、動画AIの活用シーンはさらに広がっていきそうです。
最後に
弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。
「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。
セミナー内容や料金については、ご相談ください。
また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。


