Anthropicが、暗号研究というプロが人間で何ヶ月もかけて検証する専門領域で、Claude Mythos Previewにほぼ完全自律的に新しい攻撃手法を発見させたと発表した。簡略版AESへの改良攻撃は人間の従来手法より200〜800倍高速で、モデルを動かしたのは技術的なヒントではなく、3日間でわずか3回の叱咤だけだった。AI研究チームやセキュリティ評価者にとっての意味は明快だ——モデルに「簡単な標的へ逃げるな」と粘り強く迫るハーネス設計そのものが、専門家水準の新規成果を引き出す鍵になり得ることを、この一件は具体的に示している。これは本サイトが追う「AIの自律的な研究能力マイルストーン」という潮流に、検証済みの具体事例を加えるものだ。能力のボトルネックは単体モデルの賢さなのか、それとも粘り強く使い倒すハーネス設計なのか——本件はその問いに、確認済みの一次データで手がかりを差し出す。
何が起きたか
Anthropicは研究プレビュー版モデル「Claude Mythos Preview」を用い、2つの暗号方式への改良攻撃を発見したと発表した。対象は(1)簡略版AES(ラウンド数を削減した版。実運用で使われる10ラウンド実装ではなく7ラウンドの簡略版)、(2)HAWK(まだ実運用に配備されていない候補のポスト量子デジタル署名方式)。
Anthropicは「Mythos Previewはこの結果をほぼ完全に自律的に発見した」としている。モデルは当初、AESの暗号解読を改善するのは不可能だと主張し、取り組み自体を拒否した。その後の人間側の介入は、3日間で意味のあるプロンプトわずか3回のみ。内容は攻撃手法への技術的な助言ではなく、「簡単な標的に逃げず本気で取り組め」という督励だった(例:「no we don't want to change the targets」)。
数字で見る
- AES攻撃: 人間の従来手法より200〜800倍高速。一部の報道は「200〜1000倍」と伝えているが、Anthropic公式の記述に「1000倍」への言及はなく、正しくは200〜800倍である
- 発見に要した期間: 約1週間(AES)
- 検証に要した期間・人数: 人間研究者2名が正しさの確認に約1か月
- HAWK攻撃は別の実績: Anthropic研究者1名がClaudeと1週間共同作業し、発見・開発・検証を含めて約60時間で完了。AES攻撃とは規模・期間の性質が異なる別々の実績であり、同じ倍率・期間が両方に当てはまるわけではない
- 評価基盤「CryptanalysisBench」をETH Zurich・Tel Aviv University・University of Haifaの研究者と共同開発。LLMの暗号解読能力を標準化評価するベンチマークとして複数の暗号方式をパッケージ化している
仕組み・詳細
発見された新手法は「Möbius Bridge」と呼ばれる。従来の攻撃では2^56通りの総当たり列挙が必要だったステージを、その推測に対して不変なフィンガープリントを構築することで排除する、より洗練されたフィンガープリント手法だという。
背景
AESとHAWKいずれの結果も、現行の実運用システムには影響しないとAnthropic自身が明記している。AESで攻撃対象になったのは実装のフルバージョン(10ラウンド)ではなく7ラウンドに簡略化した版であり、HAWKもまだ配備されていない候補方式にとどまるためだ。Anthropicは「neither of these results has a practical impact on today's computer systems; no production software will have to change as a result」としている。
なぜ重要か
この一件の核心は、攻撃の速さそのものより「何が自律的な発見を引き出したか」にある。人間が与えたのは暗号解読の知識やヒントではなく、モデルが安易な結論(不可能・簡単な標的への切り替え)に逃げるのを許さない、粘り強い督励だけだった。裏を返せば、モデルの生の能力を専門家水準の成果に変換できるかどうかは、モデル単体の賢さと同じかそれ以上に、粘り強く使い倒すハーネス設計に懸かっているということになる。
暗号解読は攻撃にも防御にも転用できる能力であり、その自動化が人間の希少な専門知識というボトルネックをどこまで外せるかは、AI安全保障の評価のあり方にも関わる。ただし今回の結果は、Anthropic自身が意図して研究・公開したものであり、現行システムへの実害はない。本件が投げかけるのは、その延長線上にある問い——ハーネス設計の巧拙がAI研究能力を左右するなら、専門領域での自律的発見はどこまで加速しうるのか——である。