Scale AIが刷新したのは、ベンチマークの数字を積み増すことではなく、その数字が測ってきたもの自体だ。11のリポジトリから642タスクを集め直した「SWE-Bench Pro V2」で、OpenAI GPT-5とAnthropic Claude Opus 4.1という最上位モデルの成績は、それぞれ23.3%・23.1%にとどまった。同種の上位モデルがSWE-Bench Verifiedでは70%を超えるスコアを出してきたことを踏まえると、これまで「ほぼ解けている」ように見えていたコーディング評価は、実務の複雑さを十分に映していなかったことになる。AIコーディングエージェントの採用を検討する開発チームにとっては、複数ファイル・複数言語にまたがる本物の修正作業では、フロンティア級のモデルでも成功率は4分の1に満たないと見積もり直す必要が出てきた。ベンチマークが上位モデルの実力に追いつかれて天井に張り付くたびに、より難しい後継ベンチマークへ置き換えられて評価基準そのものが引き上げられる——この繰り返しは、AIの実力を測る物差し自体が絶えず陳腐化と更新を続けているという、評価方法論をめぐる構造的な課題を改めて示している。
何が起きたか
Scale AIは、コーディングエージェントの評価基準として広く使われてきた「SWE-Bench Pro」の公開セットを刷新し、「SWE-Bench Pro V2」として公式リーダーボード(labs.scale.com)で公開した。旧版は731タスクだったが、そのうち89タスクを削除し、11のリポジトリから642タスクに絞り込んだ構成に置き換えている。
刷新の柱は、タスクの入れ替えだけでなく評価プロセス自体の見直しにある。69件のタスクで「指示内容とテストが矛盾している」問題が見つかり、これをテキスト修正した。加えて、エージェントの実行フェーズではウェブツールへのアクセスを無効化しモデルエンドポイントのみに制限したほか、すべてのエージェントの差分をクリーンな環境上で再採点する二重評価の仕組みを導入し、211タスクでは依存関係のサポートを改善したという。
数字で見る
- 642タスク/11リポジトリ——旧版(731タスク)から89タスクを削除した構成
- GPT-5: 23.3%、Claude Opus 4.1: 23.1%——公開セットでの最上位モデルのスコア
- SWE-Bench Verifiedでは70%超——同種の上位モデルがすでに到達していた水準との落差
- 69件——「指示とテストが矛盾していた」として修正されたタスク数
- 211タスク——依存関係サポートが改善されたタスク数
- 参考値として、GPT-4oは4.9%、Qwen-3 32Bは3.4%にとどまり、フロンティア級モデルとそれ以外の性能差が大きく開いていることも示された
背景
SWE-Bench Verifiedは、実際のGitHubのIssue・Pull Requestをもとにしたコーディング評価として広く定着してきたが、上位モデルの多くが70%を超えるスコアに達し、評価としての識別力が失われつつあった。SWE-Bench Pro(旧版)はより難易度の高い後継として登場していたが、今回のV2は、旧版に残っていたタスク設計上の不備(指示とテストの矛盾)や評価パイプラインの甘さ(ウェブツール経由での抜け道、汚れた環境での再採点漏れ)を修正し、モデル本来のコーディング能力をより正確に測ることを狙っている。
公開セットの構成にも特徴がある。公開データはcopyleft(GPLなど)ライセンスの下にあるオープンソースリポジトリ由来で構成されており、非公開の評価セットは汚染防止のため法的にアクセスが制限されたスタートアップの独自コードベースから作られているという。
なぜ重要か
SWE-Bench Pro V2が示した結果には、単純な難易度上昇にとどまらない特徴がある。上位モデルはリポジトリ(タスク)をまたいでも比較的安定した成績を示す一方、小規模モデルは「ある案件では中程度に成功し、別の案件ではほぼ完全に失敗する」という不安定な挙動を見せ、修正に必要な行数やファイル数が増えるほど性能が大きく劣化する傾向が確認された。これは、AIコーディングエージェントを実務に組み込む際の選定基準として、単発の簡単なバグ修正では見えてこない「複雑な複数ファイル案件でどこまで踏ん張れるか」という軸が、モデル階層を分ける実質的な分水嶺になっていることを意味する。
より大きな構図で見れば、これは評価基準そのものの耐用年数の問題でもある。フロンティアモデルが既存のベンチマークで高スコアに張り付くたびに、業界はより難しい後継ベンチマークへ乗り換え、評価の物差しを引き上げ直す——この繰り返しは、AIの実力をめぐる「性能」と「能力」の区別を絶えず問い直す作業が、ベンチマーク運営側にも常に求められ続けることを示している。