AIベンチマークの数字を読むには、運営主体・採点方式・評価範囲の3点を確認する必要がある。Agents' Last Exam(ALE)・ARC-AGI-3・Artificial Analysis Intelligence Indexという3つの主要ベンチマークを例に、一次資料に基づき整理する。

何が起きたか

2026年に入り、AIエージェントの実務遂行能力を測る新しいベンチマークが相次いで登場した。UC Berkeley RDIとRDI Foundationが主導するAgents' Last Exam、ARC Prize, Inc.が運営するARC-AGI-3、Artificial Analysisが公開するIntelligence Index(v4.1)はいずれも、単純な知識問題ではなく実務的なタスク遂行・汎化的な問題解決・複数評価の統合という異なる切り口でモデルを測定する。

仕組み・詳細

Agents' Last Exam(論文タイトル「Agents' Last Exam」、筆頭著者Yiyou Sun、v1提出2026-06-03・v2提出2026-06-11)は、米連邦職業分類O*NET/SOC 2018に準拠した13業界クラスタ・55サブ分野にまたがる1,000超(目標5,000)の非物理系タスクで構成される。300名超の業界専門家、44学術機関に加え、Goldman Sachs・JPMorgan・Morgan Stanley・PIMCO・Meta・Amazon・Adobe・Oracle・Hippocratic AI・HubSpot等が参加した。採点は「決定論的スクリプトによる採点で、LLMによる見た目判定ではない」方式で、Adobe After Effects・Siemens NX・Unreal Engine・Rhino 3D・FSLeyes・Moldex3D等の専門ソフトウェア上での実タスクを使用する。

ARC-AGI-3は「the first fully interactive benchmark in the ARC-AGI series」で、人間ゲームデザイナーが手作りした数百のオリジナルターン制環境を使い、明示的な指示・ルール・目標を与えない。測定対象はモデリング(観測から汎化可能な世界モデルを構築)・ゴール設定(明示指示なしに望ましい状態を自律的に特定)・計画と実行(軌道修正を含む)の3能力である。打ち切りルールは「a hard cutoff of 5x human performance per level」で、人間平均が10手なら50手で打ち切る。

Artificial Analysis Intelligence Index(v4.1)は4カテゴリの加重平均で構成される。

カテゴリ 重み 内訳
Agents 34% GDPval-AA v2(20%)+ τ³-Banking(14%)
Coding 24% Terminal-Bench v2.1(16%)+ SciCode(8%)
General 18% AA-LCR(6%)+ AA-Omniscience(12%)
Scientific Reasoning 24% HLE(12%)+ GPQA Diamond(6%)+ CritPt(6%)

採点はpass@1(複数回試行がある評価は全試行を集計して算出)で、「95% confidence interval for Artificial Analysis Intelligence Index of less than ±1%」としている(一部モデルは10回超の反復実験に基づく)。評価範囲は「text-only, English language evaluation suite」に限定され、画像・音声・多言語性能は別枠で評価される。

数字で見る

ALEの主要結果は「across mainstream harness and backbone configurations, the average full pass rate is below 1%」というものである。ARC-AGI-3では人間が100%を達成する一方、フロンティアAIは「0.51%」にとどまる。ARC Prize 2026の賞金体系はARC-AGI-2・ARC-AGI-3の2競技合計200万ドル超で、ARC-AGI-2のグランプリは保証型である。

背景

3ベンチマークは運営主体が異なる。ALEはUC Berkeley RDIとRDI Foundationが共同主導し、Snorkel AIがOpen Benchmarks Grantsで資金提供する非営利・学術寄りの体制である。ARC-AGI-3はARC Prize, Inc.(創設者François Chollet)が運営し、ARC Prize 2026という競技の一部として提供される。Artificial Analysisは独自のメソドロジーページで加重平均の内訳を公開しているが、運営会社・資金源・独立性についての詳細情報は公式ページから直接確認できておらず、別途調査が必要である。

なぜ重要か

「ベンチマークで90%」という数字と「実務で使える」という実感の間には差がある。ALEの完全合格率1%未満、ARC-AGI-3のフロンティアAI 0.51%という数値は、単一タスクの部分点では見えないギャップを可視化する。読み手は、運営主体(学術/非営利/民間企業)・採点方式(決定論的スクリプトかpass@1か、LLM-as-judgeを使うか)・評価範囲(言語・モダリティの限定有無)の3点を確認したうえで数値を解釈する必要がある。ALEの「目標5,000タスク」は現時点(1,000超)からの拡張計画であり、living benchmarkとして今後変動する前提で読むべき数値である。