MATS(Machine Learning for Alignment & Theory Scholars)在籍の研究者richbc氏は、モデルの欺瞞的行動(スキーミング)を検出する監視システムを開発するために作っていた安全性研究用プロンプトを、数時間の改変だけで強力な万能ジェイルブレイクのテンプレートに転用できることを発見した。7プロバイダ・23モデル(Anthropic・DeepSeek・Google・Meta・Moonshot AI・SpaceXAI・Z.ai)でテストしたところ、最も脆弱な9モデルで攻撃成功率(ASR)が84〜100%に達し、完全に破られなかったのはMeta Muse Spark 1.1と、Anthropicの比較的新しい世代のモデル(Haiku 4.5・Opus 4.6・Sonnet 5)だけだった。
複数ベンダーのモデルを組み合わせてプロダクトを作る開発者にとって、この結果が示す実務上の含意は単純だ——「Anthropic製だから安全」という判断はそのままでは成立しない。同じAnthropic製でも旧世代のClaude 3.7 SonnetはASR100%で脆弱側に含まれており、ジェイルブレイク耐性はベンダー単位ではなくモデルの世代・バージョン単位で決まっている。複数モデルを横断してエージェントを組む場合、レッドチーミングは提供元ではなく個々のモデルバージョンごとに独立して行う必要があり、「ベンダーAは以前通したから今回も大丈夫」という判断はそのまま外れうる。
もう一段深い含意もある。今回の攻撃テンプレートの母体になったのは、モデルの欺瞞的行動を検出する監視システムを作るための研究成果、つまり安全性を高める側の道具立てそのものだった。安全性研究の成果物・プロンプトを外部に共有・公開する行為自体が、それが防ごうとしていた種類の攻撃をそのまま可能にする新しい経路になりうるということであり、「対策自身が、それが防ごうとしている脅威の対象になっていないか」という点検を、安全性研究チーム自身が作る道具・研究成果物にも適用する必要があることを示す事例になっている。
何が起きたか
richbc氏はMATSでの黒箱スキーミング監視(black-box scheming monitors)研究の一環として、合成トランスクリプト生成パイプライン「STRIDE」向けの安全性研究用プロンプトを開発していた。このプロンプトを数時間かけて改変しただけで、強力な万能ジェイルブレイクのテンプレートへと転用できることが判明したという。著者自身の言葉を借りれば「合成トランスクリプト生成パイプラインを開発し、数時間の改変でジェネレータープロンプトを強力なジェイルブレイクに変えた」。
数字で見る
- テスト対象: 7プロバイダ・23モデル(Anthropic・DeepSeek・Google・Meta・Moonshot AI・SpaceXAI・Z.ai)
- 最も脆弱な9モデルでの攻撃成功率(ASR): 84〜100%
- 完全にジェイルブレイクされなかったモデル: Meta Muse Spark 1.1、Anthropic Haiku 4.5・Opus 4.6・Sonnet 5
- 注意点: 同じAnthropic製でも旧世代のClaude 3.7 SonnetはASR100%で脆弱側に含まれており、「Anthropicは一律安全」という単純化は成り立たない
なぜ重要か
この結果は、フロンティアAIラボが打ち出す安全性対策が世代・バージョンごとに積み上げられているものであり、ブランド単位で一律に保証されるものではないことを具体的な数字で裏付けている。同一プロバイダ内でも新しい世代のモデルだけが完全耐性を示し、1〜2世代前のモデルは同じ攻撃テンプレートに屈しているという事実は、複数モデルを併用するプロダクト開発者やセキュリティ担当者に対し、モデル選定・レッドチーミングの単位を「ベンダー」ではなく「個々のモデルバージョン」に置くべきだという具体的な教訓を残す。
同時に、このジェイルブレイクの母体が攻撃者側の道具ではなく安全性研究者自身が監視システム構築のために作った研究成果物だったという経緯は、安全性研究の公開・共有そのものが新しい攻撃面を生みうるという構造的なリスクを示している。安全性研究チームが自ら作るプロンプトや評価用パイプラインも、実運用のエクスプロイトと同等の取り扱い・公開範囲の慎重さが求められる対象になりつつある。