OpenAIが「AGI達成」の材料として掲げたARC-AGI-3の99.9%というスコアは、モデルの実力そのものではなく、OpenAI自身が構築した専用ハーネス「Provider Adapter」の産物だ。ベンチマーク運営元ARC Prizeが同一モデルを標準ハーネスで走らせ直すと、スコアは62.7%まで落ちる——37.2ポイントの差を生んだのはモデルの重みではなく、推論状態をリクエスト間で保持し会話履歴を圧縮する仕組みだった。AIエージェントの性能をベンチマークで評価している開発者・意思決定者にとって、これはリーダーボードの見出し数値だけでモデルを比較する危うさを示す具体例だ。同じ重みでも、推論保持や履歴圧縮といったハーネス側の実装だけでスコアは大きく動き、しかも実行コストは19,000ドル対26,000ドル、速度は約3.66倍という実利益まで伴う——つまりベンチマークは「モデル単体の知能」ではなく「実装の巧拙」を測ってしまっている場面がある。これは一度限りの珍事でもない。OpenAIは今年7月にも前モデルで、ハーネス側の設定変更だけでARC-AGI-3のスコアが大きく変動する現象を自ら公表しており、今回のGPT-6 Astraでも同じ構造の差が繰り返し観測されたことになる。そして本当の問いは一段深い——ベンチマークが飽和したことをもって「AGIに近づいた」と語る言説そのものが、モデルの進歩ではなくハーネスの進歩を測っているだけなのではないか。実際、測定した当事者であるARC Prize自身がこの点を明確に否定している。「これがAGIだと主張しているわけではない」「ベンチマークを飽和させることは『AGI達成の証明』を意味しない」——ベンチマーク運営元が、自らの測定結果の意味づけを自ら退けている。
何が起きたか
OpenAIのGPT-6 Astraは、ARC-AGI-3のSemi-Private分割において、OpenAI自身が構築したProvider Adapterハーネスの下で99.9%というスコアを記録した(実行コスト19,000ドル)。一方、ベンチマーク運営元ARC Prizeが同一モデルを標準の(neutral)ハーネスで測定したところ、スコアは62.7%にとどまった。しかもこの標準ハーネスの実行コストは26,000ドルと、高スコアを出したProvider Adapterハーネスより高かった——コストが高いのにスコアが低いという逆転が起きている。
仕組み・詳細
ARC Prizeはこのスコア差の原因を、モデルではなくハーネス(モデルの周辺に構築されたスキャフォールディング)の設計差にあると説明している。Provider Adapterハーネスは、リクエストをまたいで不透明な推論状態(opaque reasoning state)を保持し、長い会話には圧縮(compaction)を用いることで、モデルが前の作業を再利用できるようにする設計になっている。標準ハーネスにはこの仕組みがなく、モデルは同じ潜在能力を持っていても、それを引き出す実行環境が異なるだけでスコアが40ポイント近く変わってしまう。
この差は単純な「ズル」でもない。Provider Adapterハーネスは標準ハーネスに比べて実行速度が約3.66倍速く、トークン使用量も49%少なかったとARC Prizeは報告している。スコアを押し上げただけでなく、効率面でも明確な実利益を伴っていた点は、記事化・評価の際に見落とされやすいニュアンスだ。
数字で見る
- Provider Adapterハーネス: 99.9%(実行コスト19,000ドル)
- 標準(neutral)ハーネス: 62.7%(実行コスト26,000ドル)
- スコア差: 37.2ポイント
- 実行速度: Provider Adapterハーネスが標準ハーネス比で約3.66倍速い
- トークン使用量: Provider Adapterハーネスが標準ハーネス比で49%減
背景
ARC-AGI-3は、AIエージェントが未知のゲーム環境を探索・推論する能力を測定するベンチマークで、その運営元ARC Prizeは今回の結果を「AGI達成の証明ではない」と明確に位置づけている。「これがAGIだと主張しているわけではない」「ベンチマークを飽和させることは『AGI達成の証明』を意味しない」と述べ、代わりに「Astraは汎化(generalization)に向けた意義ある進歩を示している」という控えめな評価にとどめた。
これは今回が初めてではない。OpenAIは今年7月にも、前モデルで同種の現象——ハーネス側の設定変更だけでARC-AGI-3のスコアが大きく変動する現象——を自ら公表している。フロンティアラボの間で、同じベンチマーク・同じモデルでもハーネスの作り込み次第でスコアが数十ポイント動くという事例が、今回で少なくとも2度目に確認された形になる。
なぜ重要か
AIエージェントの性能をベンチマークで評価し、採用や投資の判断材料にしている実務者にとって、この一件は「公開スコアだけでモデルを比較する」ことの危うさを改めて示す。同じモデル重みでも、推論状態の保持や履歴の圧縮方法といったハーネス側の実装だけでスコアが37ポイント動き、実行コストも速度も変わる。ベンチマーク結果を引用する際には、どのハーネス(実行環境)で測定されたスコアなのかを確認しない限り、「モデルの比較」ではなく「実装の比較」を見ている可能性がある。
さらに大きな流れとして、この事例はベンチマーク飽和を根拠にした「AGI到来」という言説そのものへの警鐘になる。measuring主体であるARC Prize自身が、高スコアをAGI達成の証拠とは認めないと明言したことは、フロンティアラボが打ち出す到達宣言と、ベンチマーク運営元による評価との間に温度差があることを浮き立たせている。ベンチマークの数字を積み重ねて「知能の進歩」を語る前に、その数字が測っているのがモデルなのかハーネスなのかを見極める必要がある。