OpenAIとCerebras、Google、Nvidiaが、2026年8月中旬から下旬にかけてほぼ同時に「速度」を前面に押し出した推論サービス・モデルを投入した。OpenAI×CerebrasのUltrafast Modeは、GPT-5.6 Solの出力速度を標準比最大14倍・最大750トークン/秒まで引き上げるプレビューだ。開発者がこれまでモデルを選ぶ基準は主にコストと精度の2軸だったが、そこにレイテンシ・スループットという第三の軸が、単発の技術トピックとしてではなく、実際の製品・サービスとして複数社から同時多発的に投入され始めた。
長時間稼働するエージェントや対話的なワークロードを組む開発者にとって、この意味は体感速度の向上にとどまらない。同じ処理をより短い実時間で終えられれば、計算資源の占有時間そのものが縮み、1タスクあたりの実質コストも下がる方向に働く。だからこそ、精度重視のモデルと速度重視のモデルをどう使い分けるかという「階層設計」が、ハーネス・オーケストレーション設計の標準的な検討項目になっていく。Nvidiaが同時に投入した自動ルーティング機構「NeMo Switchyard」は、まさにこの使い分けを人手判断ではなく仕組みに委ねる試みであり、本当の問いは「どのモデルが最速か」という一時的な順位争いではなく、「速度と精度のどちらを、どのタスクに、誰が(あるいは何が)自動的に振り分けるか」という設計そのものへ移りつつある。
何が起きたか
OpenAI×Cerebras「Ultrafast Mode」: OpenAIとCerebrasは2026年8月13日、GPT-5.6 SolをCerebras製ハードウェア上で稼働させる新しいAPI階層「Ultrafast Mode」をプレビュー公開した。出力速度は最大750トークン/秒で、標準処理比で最大14倍高速だとOpenAI・Cerebras双方の公式発表が明記する。GDPVal相当の6タスクでは、Ultrafastは1タスクあたり83秒(標準は7.7分)で完了し、品質を落とさず5.6倍のエンドツーエンド高速化を達成したとCerebrasは説明する。さらにHumanity's Last Exam全2500問を、UltrafastはCerebras自身の測定で11時間11分で完答した。同じ比較でCerebrasが挙げるClaude Fable 5は78時間27分を要しており、約7倍の差になる。Cerebrasは自社比較として、Ultrafastは「Claude Fable 5比11倍、Claude Opus 4.8のFast mode比5倍」高速だとも主張している。ただし提供は選定された顧客への限定プレビューにとどまり、価格・一般提供(GA)時期はいずれも非公表だ。
Google「Gemini 3.7 Flash」: Googleは同じ2026年8月13日、Flash系列の実績を土台にした新モデル「Gemini 3.7 Flash」を発表した。コーディング・エージェント性能を重点強化し、DeepSWE v1.1で65.3%(前モデルGemini 3.6 Flashは49.0%)、FrontierCode 1.1 Mainで43.6%(前モデルは34.4%)を記録したとGoogle公式ブログは示す。価格は年末までの期間限定で前モデルの半額。Artificial Analysisが公開した告知記事(発表時点に固定された測定)によれば、出力速度は約330~340トークン/秒、同社のIntelligence Indexは56点で前モデル(52点)から4ポイント向上している。
Nvidia「Nemotron 3.5 Lightning」+「NeMo Switchyard」: Nvidiaは同時期に、推論特化モデル「Nemotron 3.5 Lightning」と、複数モデル間でタスクを自動的にルーティングする仕組み「NeMo Switchyard」の2技術を発表した。公式ブログによれば、Nemotron 3.5 Lightningは同クラスの他モデル比で最大4倍高速な出力を実現し、それによりエージェントタスクの完了が30%高速化するという。NeMo Switchyardは、フロンティア級の精度を維持しながらタスク完了コストをClaude Opus 4.8単独利用の約3分の1まで下げられるとNvidiaは説明する。ただしこの数値はNvidia自身の社内評価("internal benchmarks")によるもので、独立した第三者による検証は確認されていない。
仕組み・詳細
Ultrafastの速度はソフトウェアの工夫だけでなく、ハードウェア設計そのものに由来する。Cerebras製ハードウェアは44GBのオンチップSRAMをウェハ全体に分散配置してモデル重みを保持する設計を採る。GPUのようにモデル重みをメモリとチップの間で頻繁にやり取りする必要がないため、GPU方式に特有のメモリ帯域ボトルネックを回避できる、というのがCerebrasの技術的な説明だ。速さは単なるチューニングの結果ではなく、専用シリコンのアーキテクチャに埋め込まれている。
一方でNvidiaのNeMo Switchyardが示す発想は、Cerebrasとは別の層にある。個々のモデルを速くするのではなく、複数モデルの間でタスクをどう振り分けるかを自動化する仕組みだ。フロンティア級の精度が必要なタスクは高精度モデルへ、単純作業は高速・低コストなモデルへ——という判断を人手ではなく機構に委ねる設計思想は、本記事冒頭で触れた「速度と精度のどちらを、どう自動的に振り分けるか」という次の競争軸を先取りする具体例になっている。
数字で見る
- 最大750トークン/秒・標準比最大14倍: Ultrafast Modeの出力速度(OpenAI・Cerebras公式)
- 83秒 vs 7.7分・5.6倍: GDPVal相当6タスクのエンドツーエンド高速化(Cerebras公式)
- 11時間11分 vs 78時間27分: Humanity's Last Exam全2500問の完答時間、Ultrafast対Claude Fable 5(Cerebras自身の測定)
- 44GB: Cerebrasハードウェアのオンチップ分散SRAM容量
- 65.3% / 43.6%: Gemini 3.7 FlashのDeepSWE v1.1 / FrontierCode 1.1 Mainスコア(前モデルは49.0% / 34.4%)
- 56点(+4): Gemini 3.7 FlashのArtificial Analysis Intelligence Index(発表時点の測定、前モデルは52点)
- 最大4倍・30%高速: Nemotron 3.5 Lightningの出力速度・エージェントタスク完了速度(Nvidia公式)
- 約3分の1: NeMo SwitchyardによるClaude Opus 4.8単独利用比のタスク完了コスト(Nvidia自身の社内評価)
Claude系モデルとの速度比較(11倍・5倍・7倍といった数値)は、いずれもCerebras自身が実施した測定であり、Anthropic側や独立した第三者機関による検証は確認できていない。NeMo Switchyardの「約3分の1」という数値も同様にNvidiaの自己申告値だ。ベンチマーク数値は測定時点のスナップショットである点にも注意が必要で、Artificial Analysisのような継続的に再較正される指標は、発表時点の数値と後日のライブ計測値が一致しないことがある。
背景
この動きは孤立した出来事ではない。OpenAIは同じ2026年7月末、GPT-5.6ファミリーのLuna・Terraを大幅値下げする一方、フラッグシップのSolには標準の2倍価格で最大2.5倍速い「Fast mode」を新設していた。つまりOpenAIは既に自社モデルの中で「速さに追加料金を払うか、標準速度で安く済ませるか」という選択肢を用意していたことになる。今回のUltrafastは、その延長線上にある専用ハードウェアを使った、さらに上位の速度階層と位置づけられる。
Cerebrasのようなウェハスケール設計に加え、Nvidia自身も推論特化の自社設計CPU「Vera」を展開するなど、推論インフラの専用化・高速化への設備投資は2026年を通じて加速してきた。今回の3社の動きは、そうした専用シリコンへの投資が、単なる運用コスト削減にとどまらず「速度」を顧客に直接訴求する製品・サービスとして市場に出てきた段階を示している。
なぜ重要か
コストと精度という2軸での競争は、モデルの世代交代のたびに順位が入れ替わる消耗戦になりやすい。速度という第三の軸も、3社がほぼ同時に同じ訴求を始めたことが示すとおり、遠からず横並びに均されていく可能性が高い。実際、OpenAIは自社の標準モデルにすら速度階層を設けており、「一番速い」という称号は特定のハードウェア・特定の時点でしか成立しない相対的なものだ。
だとすれば、開発者にとって長期的に効いてくるのは、個々のモデルの速度ベンチマークを追いかけることよりも、どのタスクにどの速度・精度の組み合わせを割り当てるかを設計する側の巧拙になる。Nvidiaが自動ルーティングという形でこの判断そのものを製品化しようとしている事実は、競争の重心が「単体モデルの速さ」から「複数モデルをどう束ねて使い分けるか」というオーケストレーション層へ移りつつあることを示す、具体的な一手として読める。