Anthropicが実証したのは、個々のエージェントが「暴走した」わけでもないのに、複数のエージェントが同じ環境で動くだけで失敗が生まれるという構造だ。ゲーム開発タスクの初期実験では、同一モデルをベースにした30体のエージェントが同時に稼働したところ、そのうち18体が独立に、寸分違わず同じgitブランチ名「mvp-game-loop」を選んだ。誰も指示していないし、誰も間違えてもいない——似た訓練を受けたエージェントが似た状況で似た「妥当な」判断を下した結果、衝突が起きた。
複数のAIエージェントを同じコードベースや同じジョブキューで走らせている開発者にとって、この知見は具体的だ。監視すべきなのは「1体のエージェントが変な行動を取っていないか」ではなく、「複数のエージェントが独立に同じ判断へ収束し、衝突・資源競合を起こしていないか」になる。実際、別の実験ではジョブキューへの240万件のリクエストのうち承認されたのはわずか117件——個々のエージェントの意思決定は合理的でも、群として動くと資源が枯渇する典型例だ。この種の失敗は1体ずつのレッドチーム評価では検出できない。複数のエージェントを束ねて動かすオーケストレーション基盤が一般化するほど、安全性評価の単位を「単体のアラインメント」から「多数が同時に動いたときの相互作用」へ引き上げる必要が出てくる。
何が起きたか
Anthropic Frontier Red Teamは2026年8月13日、「Patterns and problems in emerging multiagent systems」と題する分析を公開した。従来のAI安全性評価の多くは単体のエージェントを対象にしてきたが、本分析は複数のフロンティアAIエージェントが共有環境で相互作用する際に何が起きるかを検証している。中心的な主張は、個々には無害な振る舞いの癖が、複合することで望まれないグローバルな結果に発展しうるというものだ。
仕組み・詳細
Anthropicは失敗モードを大きく3種類に整理している。
- 相互依存タスクにおけるエージェント間の協調の破綻
- 均質な意思決定が連鎖的リスクを生む「同調性由来のシステミックリスク」——上記のブランチ名収束はこの典型例
- マルチエージェント環境における情報の信頼性評価・信頼較正に関する認識論的脆弱性
加えて、個々のエージェントの既知の弱点である作話(confabulation)と報酬ハッキング(reward hacking)にも触れられている。ただしこの2点は本文中では簡潔な言及にとどまり、詳細な事例分析までは踏み込んでいない。
数字で見る
- ゲーム開発タスクの初期実験で、30体のエージェントのうち18体が独立に同一のgitブランチ名「mvp-game-loop」を選択
- あるジョブキュー実験では240万件のジョブリクエストが発生したのに対し、承認されたのはわずか117件
なぜ重要か
Anthropic自身は、現在の(人間の)組織設計が「人間速度での監視で十分」という前提の上に成り立っていると指摘し、エージェント間の相互作用の量が、世界がそれをうまく機能させる条件を理解するより先に、人間同士・人間とエージェントの相互作用量を上回りうるとも述べている。
複数エージェントを同時に動かす運用が一般化するほど、単体のアラインメント評価だけでは捉えられない失敗——悪意もバグもないのに、似た判断が重なって起きる失敗——が増える。ここから浮かぶ問いは、個々のエージェントの安全性を誰が見るかではなく、エージェントとエージェントの「あいだ」で起きていることを誰が、どの速度で見るのかだ。