AIベンチマークの数字を読むには、運営主体・採点方式・評価範囲の3点を確認する必要がある。Agents' Last Exam(ALE)・ARC-AGI-3・Artificial Analysis Intelligence Indexという3つの主要ベンチマークを例に、一次資料に基づき整理する。
何が起きたか
2026年に入り、AIエージェントの実務遂行能力を測る新しいベンチマークが相次いで登場した。UC Berkeley RDIとRDI Foundationが主導するAgents' Last Exam、ARC Prize, Inc.が運営するARC-AGI-3、Artificial Analysisが公開するIntelligence Index(v4.1)はいずれも、単純な知識問題ではなく実務的なタスク遂行・汎化的な問題解決・複数評価の統合という異なる切り口でモデルを測定する。
仕組み・詳細
Agents' Last Exam(論文タイトル「Agents' Last Exam」、筆頭著者Yiyou Sun、v1提出2026-06-03・v2提出2026-06-11)は、米連邦職業分類O*NET/SOC 2018に準拠した13業界クラスタ・55サブ分野にまたがる1,000超(目標5,000)の非物理系タスクで構成される。300名超の業界専門家、44学術機関に加え、Goldman Sachs・JPMorgan・Morgan Stanley・PIMCO・Meta・Amazon・Adobe・Oracle・Hippocratic AI・HubSpot等が参加した。採点は「決定論的スクリプトによる採点で、LLMによる見た目判定ではない」方式で、Adobe After Effects・Siemens NX・Unreal Engine・Rhino 3D・FSLeyes・Moldex3D等の専門ソフトウェア上での実タスクを使用する。
ARC-AGI-3は「the first fully interactive benchmark in the ARC-AGI series」で、人間ゲームデザイナーが手作りした数百のオリジナルターン制環境を使い、明示的な指示・ルール・目標を与えない。測定対象はモデリング(観測から汎化可能な世界モデルを構築)・ゴール設定(明示指示なしに望ましい状態を自律的に特定)・計画と実行(軌道修正を含む)の3能力である。打ち切りルールは「a hard cutoff of 5x human performance per level」で、人間平均が10手なら50手で打ち切る。
Artificial Analysis Intelligence Index(v4.1)は4カテゴリの加重平均で構成される。
| カテゴリ | 重み | 内訳 |
|---|---|---|
| Agents | 34% | GDPval-AA v2(20%)+ τ³-Banking(14%) |
| Coding | 24% | Terminal-Bench v2.1(16%)+ SciCode(8%) |
| General | 18% | AA-LCR(6%)+ AA-Omniscience(12%) |
| Scientific Reasoning | 24% | HLE(12%)+ GPQA Diamond(6%)+ CritPt(6%) |
採点はpass@1(複数回試行がある評価は全試行を集計して算出)で、「95% confidence interval for Artificial Analysis Intelligence Index of less than ±1%」としている(一部モデルは10回超の反復実験に基づく)。評価範囲は「text-only, English language evaluation suite」に限定され、画像・音声・多言語性能は別枠で評価される。
数字で見る
ALEの主要結果は「across mainstream harness and backbone configurations, the average full pass rate is below 1%」というものである。ARC-AGI-3では人間が100%を達成する一方、フロンティアAIは「0.51%」にとどまる。ARC Prize 2026の賞金体系はARC-AGI-2・ARC-AGI-3の2競技合計200万ドル超で、ARC-AGI-2のグランプリは保証型である。
背景
3ベンチマークは運営主体が異なる。ALEはUC Berkeley RDIとRDI Foundationが共同主導し、Snorkel AIがOpen Benchmarks Grantsで資金提供する非営利・学術寄りの体制である。ARC-AGI-3はARC Prize, Inc.(創設者François Chollet)が運営し、ARC Prize 2026という競技の一部として提供される。Artificial Analysisは独自のメソドロジーページで加重平均の内訳を公開しているが、運営会社・資金源・独立性についての詳細情報は公式ページから直接確認できておらず、別途調査が必要である。
なぜ重要か
「ベンチマークで90%」という数字と「実務で使える」という実感の間には差がある。ALEの完全合格率1%未満、ARC-AGI-3のフロンティアAI 0.51%という数値は、単一タスクの部分点では見えないギャップを可視化する。読み手は、運営主体(学術/非営利/民間企業)・採点方式(決定論的スクリプトかpass@1か、LLM-as-judgeを使うか)・評価範囲(言語・モダリティの限定有無)の3点を確認したうえで数値を解釈する必要がある。ALEの「目標5,000タスク」は現時点(1,000超)からの拡張計画であり、living benchmarkとして今後変動する前提で読むべき数値である。