Arenaの研究チームが、7つのAIモデルを3つの実行基盤(ハーネス)——Claude Code・Codex・Pi——の全21通りの組み合わせで検証した結果、ハーネスの違いはタスクの成功率をほとんど左右せず、コストだけを大きく左右することが分かった。研究の筆頭著者Melissa Pan氏は「シンプルなハーネスでも十分競争力を持てる」と述べている。

コーディングエージェントを実運用する開発者にとって、この結果が意味することは明確だ。ハーネスの機能を厚くしても成功率の底上げはほとんど期待できない一方、選ぶハーネス次第でコストは大きく変わりうる——つまりハーネス選定は「性能を上げる意思決定」ではなく「費用対効果を左右する意思決定」になる。エージェントを大量に、繰り返し走らせる運用ほど、この差はそのまま運用コストの差として積み上がっていく。

この知見は、AI業界の競争軸がモデル単体の賢さから「いかに安く束ねて運用するか」というオーケストレーション・ハーネス設計へと移りつつある大きな流れに位置づけられる。モデル間の性能差が縮まるほど、実行基盤の設計と運用コストの巧拙が成果を左右する比重は増していく。

本当の問いは、成功率がほぼ変わらないのに、なぜコストだけがこれほど開くのか、という点にある。研究チームが示したとされる具体的なコスト倍率や成功率の振れ幅は、複数の二次情報源で一致した数値が見られるものの、一次ソース本体(arena.aiのブログ記事および研究プロジェクトページ)がJavaScript依存のレンダリングで取得不能だったため、本記事では未検証として扱い断定はしない。ただし「複雑さを足しても成功率はほぼ動かない」という確認済みの構造から論理的に言えるのは、ハーネスの複雑さに投資することの経済合理性そのものが問い直される、ということだ。

何が起きたか

Arenaの研究チームは、7つのモデルをClaude Code・Codex・Piという3つの異なる実行基盤(ハーネス)の上で動かし、全21通りの組み合わせでコーディングタスクを検証した。結果は、ハーネスの違いがタスク成功率にはほとんど影響しない一方、コストには大きく影響するというものだった。研究の筆頭著者Melissa Pan氏は自身のXアカウントで「ハーネス選びは成功率にはほとんど影響しないが、コストには大きく影響しうる」「シンプルなハーネスでも競争力を持てる」と投稿し、この結果を要約している。

なお、この研究の一次ソースであるarena.aiのブログ記事本体、および同チームの研究プロジェクトページ(harnesstax.github.io)は、いずれもJavaScript依存のレンダリングによりWeb取得ツールでの本文確認ができなかった。本記事はMelissa Pan氏本人のX投稿で直接確認できた範囲の主張のみを確認済み事実として扱っている。

仕組み・詳細

ここでいう「ハーネス」とは、モデル本体ではなく、モデルがコーディングタスクを実行する際に使うツール群・プロンプト構成・実行制御など、モデルを取り巻く実行環境を指す。同じモデルでも、どのハーネスに載せて動かすかによって、呼び出せるツールの種類や実行の進め方が変わる。今回の検証では、Claude Code・Codex・Piという3つの異なるハーネスが比較対象になった。

研究チームの結論は二段構えだ。第一に、どのハーネスを選んでもタスクの成功率は大きくは変わらない。第二に、それにもかかわらずコストはハーネスによって大きく変わりうる。この非対称性——「成功率には効かないが、コストには効く」——が、研究チームが「ハーネス税(harness tax)」と呼ぶ現象の核心である。

数字で見る

一次ソースで確認できた定量的な事実は、検証構成そのもの——7モデル×3ハーネス=21通り——にとどまる。具体的なコスト倍率(特定のハーネスが他より何倍高いか)や、ハーネス間の成功率の振れ幅を示す数値は、複数の二次情報源で一致した報道が見られるものの、一次ソース本体に到達できなかったため、本記事では未検証として扱い、数値としては掲載しない。

背景

コーディングエージェントの実行基盤としては、Claude CodeやCodexのように多機能なツール群を備えたハーネスが広く使われるようになってきた。機能が豊富なハーネスほどタスクの成功率を押し上げるという想定は、エージェント開発の現場で自然に共有されてきた前提だと言える。今回の検証結果は、その前提——ハーネスの機能を厚くすることが成功率に直結するという想定——に反証を突きつけるものだ。

なぜ重要か

エージェントを本番で運用するチームにとって、ハーネス選定はこれまで「どれだけ多くのタスクをこなせるか」という性能の問題として扱われがちだった。今回の検証結果は、その軸を「同じ性能をどれだけ安くこなせるか」というコストの問題へと組み替える。モデル単体の性能競争が飽和に近づくほど、実行基盤のコスト構造そのものが、エージェント運用の意思決定を左右する変数になっていく。