Anthropicは2026年8月のRisk Reportで、社内限定モデル『Model 2』を外部公開しない方針を示すと同時に、自動化された研究開発(R&D)能力を測る自社評価が「飽和(saturated)」し能力上昇を検知する感度自体が落ちていると自己申告した。同時期にOpenAIは、次期モデル『Astra』の予備評価が重大(Critical)なサイバー能力を「否定できない」水準に達したとして、対策未整備の内部活動を一時停止した。この2件は「Anthropicは減速せず、OpenAIは減速する」という対比で語られがちだが、実態はどちらも自社の安全性フレームワークに基づく限定的な出し控えであり、非対称なのは減速の有無ではなく出し控えの単位——Anthropicはモデル単位の選択的非公開、OpenAIは危険能力の閾値に基づく活動停止——にある。AIベンダーの安全性主張を採用判断や監査に使う実務者にとって重要なのは、どちらが「より安全か」の比較ではなく、両社とも危険度を測る自社評価そのものが能力の伸びに追いつけなくなりつつあると認めている点だ。フロンティアAIの安全性ガバナンスは、危険な能力にどう対策するかという段階から、対策の前提となる測定手法自体の限界とどう向き合うかという段階に移りつつある。

何が起きたか

Anthropicは2026年8月14日公開のRisk Report(Responsible Scaling Policy v3.4に基づく、2026年2月に続く2回目の会社全体版)で、公開モデルClaude Mythos 5より「多くの社内タスクで明確に上回る」社内限定モデル『Model 2』の存在を明らかにした。同社は「外部公開する計画は現時点でない」と明言している。同じレポートでAnthropicは、高リスク状況における誤整合(misalignment)による破局的被害のリスク評価を「very low」から「low」へ引き上げたことも開示した。区分としては引き続き「低い」カテゴリだが、悪化方向への改定である点に注意が必要だ。

一方OpenAIは、次期主力モデルの内部バージョン『Astra』について、直近の予備評価がサイバーセキュリティ分野で強力な性能を示し「現時点でCritical(重大)能力水準を排除できない」との結論に至ったとして、対策未整備の内部Astra関連活動を一時停止したと公表した。Preparedness Framework上、この閾値への到達可能性を自ら否定できないとした同社初の事例とされる。全エージェント的用途(訓練・評価を含む)への全面的モニタリング導入や、政府機関・AI安全団体との追加テストも進めるとしている。

数字で見る

  • Anthropicの自動化R&D能力評価: 「加速の初期兆候(early signs of acceleration)」を確認。「Claudeは現在、Anthropicの本番コードベースにマージされるコードの大部分を書いている」と開示。ただしこの脅威モデルを判定する具体的タスクベース評価は「飽和(saturated)」しつつあり、能力上昇そのものを検知する感度が低下している——リスク評価が「low」に据え置かれているのは、リスクが変わっていないからなのか、測定の解像度が下がっているからなのかを、この開示だけでは切り分けられない。
  • 誤整合リスク: 「very low」→「low」(カテゴリ内での悪化方向の格上げ)。
  • (未検証・二次報道のみ)CoBenchベンチマークでModel 2が62.8%、Mythos 5が50.3%とする報道が複数あるが、一次ソースでの逐語確認はできていない。

背景

両社ともフロンティアモデルの危険能力を独自の枠組み(AnthropicはResponsible Scaling Policy、OpenAIはPreparedness Framework)で評価し、一定の閾値を超えた場合に開発・公開を制限する仕組みを持つ。今回の2件は、その仕組みが実際に発動した事例にあたる。ただし発動の単位は異なる。Anthropicは特定の1モデル(Model 2)を選択的に非公開にする判断であり、開発計画全体を止めるものではない。OpenAIは特定の能力閾値(Critical)への到達可能性を理由に、対策が整うまで一部の内部活動を止める判断であり、これもAstraの提供・開発全体の停止ではない。

なぜ重要か

この2件は「Anthropicは減速せず、OpenAIは減速する」という単純な対比で語られがちだが、両社の一次資料を突き合わせると、実際には両社とも「特定モデル・特定用途に限定した出し控え」という同じ種類の対応を取っている点で共通する。相違点は減速の有無ではなく、出し控えの単位(モデル単位か、能力閾値単位か)にある。

AIベンダーの安全性主張を採用判断や監査に使う実務者にとって重要なのは、どちらのラボが「より安全か」を比較することではない。Anthropicが自ら「評価ベンチマークが飽和し能力上昇を検知しにくくなっている」と認めた事実は、フロンティアモデルの安全性報告が抱える構造的な限界を示している。モデルの能力が伸びるスピードに、それを測る評価手法の更新が追いつかなくなっているなら、「リスクは低いまま」という開示された評価結果だけを根拠に、実際のリスク水準を判断することはできなくなる。フロンティアAIの安全性ガバナンスは、危険な能力にどう対策するかという段階から、対策の前提となる測定手法自体をどう更新し続けるかという、もう一段深い課題に移りつつある。