SpaceXAIが発表した新モデル「Grok 4.6」の核心は、ベンチマーク順位そのものより、その順位にどれだけの計算コストで到達したかという点にある。Artificial Analysisの計測によれば、Grok 4.6は長期タスク遂行能力を測るAA-Briefcaseで2位、GDPval-AA v2でも2位という、いずれもClaude Opus 5に次ぐ成果を、Claude Opus 5の約半分のターン数(53 vs 103)・4分の1の入力トークン量(約0.5B vs 約2.0B)で達成した。コーディングエージェントを大量に回す開発者にとっては、同水準の成果をより少ない呼び出し回数・トークン消費で得られることを意味し、エージェントループの実運用コストを直接圧縮できる可能性がある。
この効率は偶然ではない。Grok 4.6は、Cursorのコーディングエージェントデータと、潤沢な計算資源を持つSpaceXとの提携(2026年4月合意)から生まれた初の本格的な成果であり、実運用のエージェント軌跡データを持つ企業と計算資源を持つ企業が資本面まで統合することで、単純なベンチマーク点数だけでなく「同じ成果に到達するまでのコスト」でも差をつけ始めていることを示す事例になる。
何が起きたか
SpaceXAIは2026年8月12日、視覚言語作業と長時間稼働のエージェント作業に重点を置いた新モデル「Grok 4.6」を発表し、API・Grok Build・Cursor経由で提供を開始した。コンシューマー向けGrokアプリでの提供時期については、公式発表ページの取得範囲内に該当する記述がなく確認できていない(未検証)。
Cursor提携の経緯
- 2026年4月: CursorとSpaceXAIが、Cursorのコーディングエージェントデータの活用とSpaceXの計算資源を組み合わせてモデル訓練を加速する提携を発表。買収オプション付きの合意だった。
- 2026年7月8日: 前身モデル「Grok 4.5」がCursorと共同訓練されて公開。Artificial AnalysisのIntelligence Indexは、その前のGrok 4.3の38点から56点へ上昇した。
- 2026年8月14日: Cursorの買収がクローズし、Cursor公式ブログが「Cursor has officially been acquired by SpaceX」と発表(Grok 4.6発表の数日後)。買収額や取引形態については同ブログに明記はないが、複数の独立報道が600億ドル規模の全株式取引だったと伝えている。
- 2026年8月17日: Cursorが、Grok 4.6を含む買収クローズから3日後、GitHub対抗のコードホスティング機能「Origin」を発表した。
Grok 4.6のIntelligence Indexは61点で、Grok 4.5の56点からさらに5点上昇している。「SpaceXAI」というブランド名自体、SpaceXによるCursor買収完了後に前面に出てきたもので、買収前のGrok 4.5は「xAI」表記が主だった。
数字で見る
Artificial Analysisの計測に基づく主要な位置づけは以下のとおり。
| 指標 | Grok 4.6 | 順位・比較 |
|---|---|---|
| Intelligence Index | 61点 | 3位タイ(GPT-5.6 Solと同点。1位Claude Opus 5=63点、2位Claude Fable 5=62点) |
| GPQA Diamond | 94.9% | 全モデル中トップ(2位Gemini 3.7 Flash 94.5%、3位GPT-5.6 Sol 94.1%) |
| Terminal-Bench 2.1 | 88.4% | 3位(1位GPT-5.6 Sol 89.5%、2位Claude Opus 5 89.1%) |
| AA-Briefcase | 1,577 Elo | 2位。Claude Opus 5(1,720 Elo)に次ぎ、Claude Fable 5(1,574 Elo)をわずかに上回る |
| GDPval-AA v2 | 1,753 Elo | 2位。Claude Opus 5(1,861 Elo)に次ぐ |
| τ³-Bench Banking | 50.7% | 2位(1位Qwen3.8-Max 51.3%) |
AA-BriefcaseとGDPval-AA v2の順位関係を伝える一部報道はClaude Opus 5の数値をやや低く伝えているが(それぞれ1,715 Elo・1,849 Eloなど)、Artificial Analysisの一次データではいずれも数点〜十数点高く、上表はその一次データに基づく数値を採用している。順位関係自体(Grok 4.6が2位)にずれはない。
コスト効率の実測値としては、Grok 4.6はClaude Opus 5と同等水準の成果に、約半分のターン数(約53 vs 約103)・4分の1の入力トークン量(約0.5B vs 約2.0B)で到達している。
仕様・価格
- コンテキスト: 入力上限50万トークン、出力上限なし
- 出力速度: 58.4トークン/秒(Artificial Analysis計測)
- 知識カットオフ: 2026年2月1日
- 推論レベル: low / medium / high / xhigh の4段階、デフォルトはhigh
- 対応機能: function calling、web検索、X検索、サンドボックスでのコード実行
- 価格(100万トークンあたり): 入力$2.00/キャッシュ$0.50/出力$6.00(20万トークン超は高レート)。処理速度が2倍の高速版は価格も2倍(入力$4.00/キャッシュ$1.00/出力$12.00)
パラメータ数について、「約1.5兆」という数字が一部の報道で言及されているが、実測ベンチマークを提供するArtificial Analysis自身は「モデルサイズ・パラメータ数は非公開」と明記している。SpaceXAI自身も公式発表でパラメータ数を開示していないため、この数字は事実として扱えない。
なぜ重要か
Grok 4.6が示すのは、単体モデルの賢さを競うレースに、もう一つの評価軸——同じ成果に到達するまでのターン数・トークン消費、つまり実務コスト——が実測値として乗ってきたということだ。Claude Opus 5とほぼ並ぶ成果を半分のターン数・4分の1の入力トークンで出せるなら、エージェントを本番運用する開発者にとっては、モデル選定の基準が「最高スコアはどれか」から「同じ品質をいくらで買えるか」へ移る。
そしてこの効率は、Cursorの実運用エージェントデータとSpaceXの計算資源という、性質の異なる2つの資産を資本面まで統合した結果として生まれている。エージェントの実行軌跡データを大量に持つ企業と、計算資源を潤沢に持つ企業が合流することで、ベンチマークの点数だけでなく「その点数に到達するコスト」でも優位に立てる——モデル開発の競争軸が、これまでのようなデータ規模や計算資源の量だけでなく、実運用データと計算資源をどう組み合わせるかという垂直統合の巧拙にも広がりつつあることを、Grok 4.6の数字は具体的に裏付けている。