Googleが動画解析で崩したのは、コストと精度が引き換えになるという前提そのものだ。Geminiに追加された「エージェント型動画理解」は、トークン消費を最大88%・分析コストを最大66%削減しながら、精度も最大7%引き上げた——普通は片方を削れば片方が犠牲になる関係が、同時に改善している。動画を扱うAIアプリケーション開発者にとっては、モデルを差し替えることなくAPI設定を1行変えるだけで、レイテンシとコストと精度をまとめて改善できる話になる。そして技術的な理由は単純だ。これまでの「毎秒1フレームを機械的に読む」処理そのものが、無駄な読み込みと重要箇所の見落としを同時に生んでいた。Googleが7月に投入したGemini 3.6 Flash・3.5 Flash-Lite・3.5 Flash Cyberが示した「フラグシップの知能でなく実務で大量に呼ばれるFlash系の運用コストを磨く」路線の延長線上に、今回は動画という個別モダリティでの具体化が加わった格好だ。

何が起きたか

Googleは2026年9月1日、公式ブログ「Introducing agentic video in Gemini」で、Geminiの動画解析に「エージェント型動画理解(agentic video understanding)」を追加したと発表した。著者はGoogle DeepMindのRohan DoshiシニアプロダクトマネージャーとMario Lučić研究ディレクター。対象はGemini 3.7 Flash・Gemini 3.6 Flash・Gemini 3.5 Flash-Liteの3モデルで、いずれもFlash系に限られ、Proシリーズは対象に入っていない。Gemini API経由でGoogle AI Studio・Gemini Enterprise Agent Platformにて即日利用可能になっている。

仕組み・詳細

従来の動画処理は「静的(static)」と呼ばれる方式で、モデルは動画をデフォルト毎秒1フレーム(APIで調整可能)の固定レートで機械的に取り込んでいた。これに対しエージェント型動画理解は、モデルの中核的な推論能力とネイティブの動画ツールを組み合わせ、視覚フレーム・音声・文字起こしを横断して対象の動画セグメントを動的に探索・走査・検査する。つまり「何を・どの速度で・どのモダリティで見るか」をモデル自身が能動的に判断する設計に置き換わった。

有効化の方法はシンプルで、API設定のprocessingパラメータを"agentic"に指定するだけ。追加コストは発生せず、標準のGemini APIトークン料金がそのまま適用される。

数字で見る

指標 効果
トークン消費 最大88%削減
分析コスト 最大66%削減
精度 最大7%向上
対象モデル Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Lite
追加コスト なし(標準のGemini APIトークン料金)

背景

Googleは2026年7月21日にもGemini 3.6 Flash・3.5 Flash-Lite・3.5 Flash Cyberを発表し、「本番運用のAIエージェントを安く速く」動かすことを掲げていた。今回の対象に含まれる「Gemini 3.7 Flash」は7月時点では未発表だったモデルで、3.5→3.6→3.7という形でFlash世代が継続的に更新されていることを示している。フラグシップの「Gemini 4」は7月時点で事前学習が始まったばかりで仕様・時期とも非公開のままであり、Googleは看板モデルの完成を待つ間もFlash系の運用コストを継続的に磨き続けている。

なぜ重要か

動画理解タスクでは通常、処理を軽くすれば見落としが増え、精度を上げれば処理量とコストが膨らむというトレードオフが前提になる。今回の数値が示すのは、そのトレードオフが「固定レートで一律に読む」という処理方式そのものに起因する無駄だったという点だ。同じ動画から同じ答えを引き出すのに、モデルが必要な箇所だけを能動的に探す設計に変えるだけで、消費リソースと精度の両方が改善した。動画を扱う開発者にとっての次の論点は「どのモデルを使うか」よりも「処理をどう割り当てるか」に移りつつあり、これはGoogleがFlash系全体で進めてきた「安く速く回す」路線の中でも、モダリティ単位の処理設計そのものを最適化しにいった具体例として位置づけられる。