OpenAIが自らのブログで明かしたのは、難関ベンチマークARC-AGI-3でのGPT-5.6 Solの低スコアが、モデルの実力不足ではなくAPI設定の問題だったという事実だ。公式ハーネス上でのスコアはPublic分割で13.3%にとどまっていたが、ChatGPTやCodexで既に使われている「保持された推論」と「圧縮」という2つのAPI設定を有効にしただけで、同じモデルのスコアは38.3%(約3倍)に跳ね上がり、出力トークン数は6分の1まで減った。エージェントを実運用に組み込む開発者にとって意味は明快だ——公開リーダーボードの数字だけで「このモデルは弱い」と判断するのは早計で、推論の保持・履歴管理・プロンプト設計といったハーネス側の作り込み次第で、同じモデルでも性能とコストが数倍単位で変わりうる。これは、フロンティアラボの競争力の源泉が、鍛え上げた生のモデル性能そのものだけでなく、それをChatGPTやCodexのような製品・エージェント基盤としてどう実装し届けるかという層にも広がりつつあることを示す一事例でもある。そして本当の問いは一段深い——ハーネス設定だけでスコアが3倍に変わりうるなら、ラボ間で公表され比較されるベンチマークの数字は、実際には「モデルの比較」ではなく「ハーネス実装の比較」になってしまっている場面があるのではないか、という点だ。
何が起きたか
OpenAIは公式ブログ記事「How two settings tripled our ARC-AGI-3 scores」で、新モデルGPT-5.6 SolのARC-AGI-3ベンチマーク結果について詳細を明らかにした。ARC-AGI-3は、AIエージェントが2Dパズルゲームを学習・推論する能力を測定するベンチマークである。GPT-5.6 Solは当初、ARC Prizeの公式ハーネス上でPublic分割13.33%・Semi-Private分割7.78%というスコアにとどまっていた(前世代のGPT-5.5は0.4%)。一方でGPT-5.6 Solは、数学の問題を解いたり『ポケットモンスター ファイアレッド』のようなゲームをクリアするなど、ベンチマークのスコアからは想像しにくい高い能力を別の場面では示していた。この乖離を受けてOpenAIは公式ハーネス自体に構造的な問題があるとみて、自社のResponses APIでARC-AGI-3ハーネスを独自に再実装し、原因を調べた。
仕組み・詳細
OpenAIが特定した問題は2つある。1つ目は、公式ハーネスがエージェントの各アクション実行後に、それまでの内部推論(private reasoning)をすべて破棄していたことだ。モデルは次のアクションを考えるたびに前のターンでどう考えたかを参照できず、分析をゼロからやり直す羽目になっていた。この対処が「保持された推論(retained reasoning)」で、内部の思考をターンをまたいで保持し続ける設定だ。2つ目は、行動履歴が蓄積するにつれて古いアクションが単純に切り捨てられる「ローリング切り捨て(rolling truncation)」方式が使われていたことで、モデルは長期的な文脈を失っていた。これに対処するのが「圧縮(compaction)」で、古い履歴を単純に切り捨てるのではなく要約して保持することで、知的な要約に置き換える。どちらもOpenAIが今回のために発明した特殊機能ではなく、ChatGPTやCodexで既に使われているResponses APIの標準設定だとOpenAIは説明している。
数字で見る
OpenAIがResponses APIで独自に再実装したハーネスに、保持された推論と圧縮の両方を有効にして計測したところ、Public分割のスコアは13.3%から38.3%へと約3倍に向上し、出力トークン数は6分の1に減少した。ここで基準値の取り違えに注意が必要だ。先に触れられる7.8%(Semi-Private分割の公式スコア)がそのまま3倍になったかのように読めてしまいがちだが、OpenAIが明示する「3倍」の基準はPublic分割の公式スコア13.3%であり、7.8%とは別の集計軸である。さらに、38.3%という数字はARC Prizeの公式リーダーボードに掲載された検証済みスコアではなく、OpenAI自身がResponses APIで再実装したハーネス上で得た自己申告値だ。ARC Prizeの公式結果ページ(arcprize.org/results/openai-gpt-5-6-sol)には、本記事作成時点でPublic13.33%・Semi-Private7.78%のみが掲載されており、38.3%についての第三者検証・公式リーダーボードへの掲載は確認できていない。
背景
ARC-AGI-3は、静的なQ&A形式の従来ベンチマークと異なり、エージェントが2Dパズルゲームの中で複数ターンにわたって行動し続けながら学習・推論する能力を測る。そのためモデル単体の性能だけでなく、推論をどう保持し、履歴をどう管理し、プロンプトをどう設計するかという「ハーネス」側の設計が結果を大きく左右する。OpenAIは今回この点を自社ブログで率直に認め、評価がモデル単体を測ることは稀だと結論づけている。
なぜ重要か
今回の事例が示すのは、ベンチマークのリーダーボードに並ぶ数字を、モデルの実力そのものとして単純比較することの危うさだ。同一モデル・同一ベンチマークでも、API設定というユーザーの目に触れにくい選択だけでスコアが3倍、コストに直結する出力トークン数が6分の1に変わりうる。エージェントを実運用に組み込む開発者にとっては、公開ベンチマークの順位だけでモデルを選ぶのではなく、自分たちのユースケースでハーネス(推論保持・履歴管理・プロンプト設計)をどう組むかが、最終的な性能とコストを左右する主戦場になる。ラボ側にとっても、今回OpenAIが自ら実証したように、モデルを鍛えるのと同じかそれ以上に、そのモデルを届けるAPI・エージェント基盤(ハーネス)を磨くことが競争力の源泉になりつつある。