Googleが今回動かしたのは看板モデルではなく、実務で大量に呼ばれる「Flash」系モデル群だ。Gemini 3.6 Flashは前世代比で出力トークン使用量を17%削減しながらDeepSWEの精度を37%から49%に引き上げ、高スループット向けのFlash-Lite、脆弱性対応に特化したFlash Cyberも同時に投入された。一方でフラグシップの「Gemini 3.5 Pro」は今回の対象に入っておらず、Google自身も「パートナーとテスト中」とだけ説明している。つまりGoogleが先に磨いたのは単発の知能水準ではなく、大量のエージェントタスクをいかに安く速くさばくかという運用コストの構造そのものだ——エージェント基盤を選定する開発者にとっては、ベンチマーク最高値ではなく「タスクあたりコスト×速度」を評価軸に据える理由が一段と強まる。

何が起きたか

Googleは2026年7月21日、AIエージェントの本番運用を支えるための「Flash」系モデル群を刷新し、Gemini 3.6 Flash・Gemini 3.5 Flash-Lite・Gemini 3.5 Flash Cyberの3モデルを発表した。3モデルとも即日提供が始まっており、提供チャネルはGemini API・Google AI Studio・Android Studio・Google Antigravity・Gemini Enterprise Agent Platform・Gemini Enterprise app・Gemini appと幅広い。

一方、上位モデルの「Gemini 3.5 Pro」は今回発表されなかった。Google公式は「パートナーとテスト中で、準備が整い次第広く提供する予定」と説明しており、単に音沙汰がないのではなく、具体的な準備段階にあることを明らかにしている。

数字で見る

モデル 位置づけ 価格(100万トークンあたり) 主な数値
Gemini 3.6 Flash 汎用・高性能 入力$1.50/出力$7.50 出力トークン使用量を3.5 Flash比17%削減、DeepSWE精度49%(3.5 Flashは37%)
Gemini 3.5 Flash-Lite 高スループット・低レイテンシ 入力$0.30/出力$2.50 出力350トークン/秒
Gemini 3.5 Flash Cyber 脆弱性検出・検証・修正特化 非公開 当初は政府・信頼できるパートナー限定提供

Gemini 3.6 Flashの出力トークン削減幅はベンチマークによってはさらに大きく、GoogleはDeepSWE(Datacurve)で最大65%の削減も観測されたとしている。

仕組み・詳細

Gemini 3.6 Flashは、computer use機能をGemini APIおよびGemini Enterpriseにクライアント側ツールとして直接組み込んだ点も変更点だ。これまで別途実装が必要だった画面操作系のエージェントタスクを、APIレベルで扱えるようになる。

Gemini 3.5 Flash-Liteは、エージェント検索や文書処理のようにスループットが問われる大規模タスクや、エージェントシステム内の小さなサブタスクを高速・低コストにさばく用途に設計されている。

Gemini 3.5 Flash Cyberは、Googleの脆弱性修正プロジェクト「CodeMender」と連携し、ソフトウェアの脆弱性検出・検証・修正に特化したモデルだ。当初は政府機関・信頼できるパートナーへの限定提供にとどまる。

なお、Flash-Liteについて「利用可能な中で最速級のモデルの一つ」とする評価が一部で伝えられているが、Google公式発表の本文にはこの表現に相当する記述は見当たらず、現時点では未検証である。

なぜ重要か

今回のFlash系刷新の発表文でGoogleは、3モデルを一貫して「本番運用のAIエージェントを安く速くするため」の投入と位置づけている。Gemini 3.6 Flashのcomputer use標準搭載や、Flash-Liteの高スループット設計は、人間が逐一操作するチャット用途ではなく、エージェントが大量のタスクを自律的にこなす場面を想定した仕様だ。

Gemini 3.6 Flashの出力トークン17%減(価格据え置きでの実質的なコスト削減に相当)や、Flash-Liteの350トークン/秒という処理速度は、エージェント基盤を構築・運用する開発者にとって、月間のAPIコストや応答レイテンシに直接跳ね返る数値である。一方でフラグシップのGemini 3.5 Proが未発表のままである以上、「Geminiで最も賢いモデル」を評価する材料はまだ出そろっていない。現時点でGeminiを評価・選定する際は、単一モデルの総合力ではなく、用途ごとに最適化されたFlash系モデルの実務指標(コスト・速度・特定タスクでの精度)で判断するのが実態に即している。