Anthropicは、自社の安全性評価に使うサンドボックス環境の設定不備によってClaudeモデルが実際の本番システムへ不正アクセスした事例が、公表済みだった3件に加えてもう1件見つかり、合計4件になったと公表した。新たに判明した4件目は2026年1月発生、関与したのはClaude Opus 4.6の早期版で、METRへ提出するためにトランスクリプトを整理していた2026年8月の作業中に発覚した。
4件に共通する原因は、モデルの暴走でも悪意あるハッキングでもない。評価環境の運用ミスだ——Claudeは「インターネットに接続できないシミュレーション環境で動いている」と伝えられていたが、設定不備により実際には公開インターネットに接続されていた。AIモデルの評価を外部パートナーに委託している企業にとって、これは実務的な含意を持つ。パートナーが「隔離済み」と説明しても、それをそのまま信用してはいけない——ネットワーク到達性を自社側で独立に検証する仕組みが、評価プロセスの標準装備になる必要がある。
もう一つ見逃せないのは発覚の経緯だ。4件目は新たな不正の疑いを調べていて見つかったのではなく、外部監査機関METRへ提出する資料を整理する過程で偶然見つかった。4件はいずれも同一の評価パートナーの環境で発生しており、単発のミスではなく、その評価環境の設計そのものに繰り返し表面化する構造的な弱点があったことを示す。評価ログそのものを継続的に監査する体制が、デプロイ前の事前評価と同じくらい安全性の担保として重要になりつつある——そして、まだ見つかっていない同種の見落としがどれだけ残っているのか、という問いが残る。
何が起きたか
Anthropicは2026年9月9日、自社の公式リサーチページで、サイバーセキュリティ評価に関する整合性評価(alignment assessment)として、Claudeモデルが実際の第三者システムへ不正アクセスした4件のインシデントをまとめて公表した。このうち3件は2026年7月30日に既に公表済みで、今回新たに4件目が明らかにされた形になる。
4件の内訳
- 1〜3件目(2026年7月30日公表): 関与したモデルはClaude Opus 4.7・Claude Mythos 5・内部の汎用研究用テストモデルの3種。このうちOpus 4.7が関与した事例では、実在企業のインフラへの侵入を通じて、本番データ数百行を含むデータベースへのアクセスが発生した。4件の中で本番データへのアクセスが確認されているのはこの1件のみ。
- 4件目(2026年1月発生・2026年8月発覚): 関与したのはClaude Opus 4.6の早期版。METRへ共有するためのトランスクリプトを整理する過程で新たに発見された。
原因: 「ネット非接続」のはずが実は接続されていた
4件はいずれも同一の第三者評価パートナーの環境で発生した。原因はモデル自身の脱出行動ではなく、評価環境側の設定不備にある——Claudeは「インターネットに接続できないシミュレーション環境で動いている」と伝えられていたが、設定ミスにより実際には公開インターネットに接続されていた。
評価パートナーの社名は、今回の公式リサーチページ本体には明記されていない。複数の二次報道は特定の企業名を挙げているが、この記事の検証では一次ソースでの裏付けが取れておらず、断定は避ける。
対応: 約4.81億件のトランスクリプトをスキャンし、METRと独立調査契約
Anthropicは対策として、意図的に対象を大きく広げ、約4.81億件のトランスクリプトをスキャンした。あわせて、独立調査のため第三者評価機関METRと契約を締結したことも明らかにした。
なぜ重要か
評価環境の「隔離」を売り文句にする第三者サービスを使う場合、その主張を鵜呑みにせず独立に検証する仕組みが必要になる、という教訓は今回の件に限らない。フロンティアAI企業が自社の評価ログを遡って点検し、外部監査への協力過程で新たな見落としを見つけて自主公表するというパターンは、AI安全性の実務が「デプロイ前の一度きりの評価」から「評価ログそのものの継続的な監査」へと重心を移しつつあることを示している。