Z.aiが2026年8月14日に発表した「GLM-5.3」は、前世代GLM-5.2と同一のベースモデルにポストトレーニングを積み増しただけのモデルだ。それだけで脆弱性発見ベンチマークCyberGymのスコアは84.5%に達し、Anthropicが公開範囲を制限する「Mythos 5」(83.8%)を上回った。新しいベースモデルを一から学習し直さなくても、危険な能力の評価スコアはポストトレーニングの積み増しだけで動く——これは、モデルの安全性評価や監視の単位を「新しい世代の登場」だけに置いてよいのかという前提を揺さぶる事実だ。
開発者にとっての意味は具体的である。同じベース資産を使い回しながらポストトレーニングだけを継続的に重ねる運用が広がれば、既存モデルが新しい学習ランを経ずに数週間単位で能力プロファイルを塗り替えるようになる。ベンチマーク上の「今のランキング」はますます短命になり、危険能力の評価・監視も新モデルのリリースだけでなく、既存モデルのポストトレーニング更新自体を追う必要が出てくる。同時にZ.aiは、ダウンロード可能な重みの公開を安全性評価・堅牢化の完了まで2週間延期すると発表した。攻撃的サイバー能力のガバナンスは、クローズドなフロンティア企業だけの課題ではなくなりつつある。
何が起きたか
- Z.aiは2026年8月14日、新モデル「GLM-5.3」を公式ブログで発表した。
- 性能向上はすべてポストトレーニングの拡大によるもので、ベースモデルはGLM-5.2と同一。過去1か月、環境の多様化・タスクの多様化・投入計算量の増加でポストトレーニングをスケールしたとZ.aiは説明している。
- サイバー脆弱性の発見能力を測るCyberGymベンチマークで84.5%を記録し、Anthropicの「Mythos 5」(83.8%)・OpenAIの「GPT-5.6 Sol」(83.6%)を上回るベンチマーク最高値を達成した。
- 一方、脆弱性の悪用(エクスプロイト開発)を問うExploitBenchでは、GLM-5.3は54.4%(前世代GLM-5.2の24.4%からは倍増)にとどまり、Mythos 5(78.0%)・GPT-5.6 Sol(76.5%)に明確に及ばない。
- 実世界のテストでは269のプロジェクトから2,436件の脆弱性を発見し、うち1,097件が中〜高深刻度だった。
- Z.aiはダウンロード可能な重みの公開を、安全性評価と堅牢化が完了するまで約2週間延期すると発表した。
「サイバー性能でMythos 5超え」は半分だけの話
GLM-5.3の結果は、単純に「サイバー性能でフロンティアを超えた」とまとめるには非対称すぎる。CyberGym(脆弱性の発見)ではMythos 5を上回ったが、ExploitBench(発見した脆弱性の悪用、より深い推論を要求する)では、GLM-5.2からの倍増を果たしてなおMythos 5・GPT-5.6 Solに大きく水をあけられている。「脆弱性を見つける」力と「見つけた脆弱性を実際に突く」力は別の能力であり、GLM-5.3が到達したのは前者だけだ。
なお、「サイバー性能がMythos 5を超えたために重み公開を延期した」という説明が一部で流布しているが、これは正確ではない。Z.ai公式ブログが明示する延期理由は「安全性評価と堅牢化が完了するまで」の一点のみで、Mythos 5超えとの明示的な因果関係は公式には述べられていない。両者の事実(ベンチマークでの優位・重み公開の延期)は同じ記事内で並べて語られているが、それを単純な因果として結びつけるのは報道側の解釈である。
背景: Mythos 5とは何か
比較対象の「Mythos 5」は、Anthropicがサイバーセキュリティ・生命科学分野向けに公開範囲を制限している実在のモデルである。脆弱性発見や創薬、バイオディフェンスに特化し、二重用途リスクの大きさから一般公開されていない。GLM-5.3は、こうした意図的にアクセス制限がかけられているフロンティアモデルの評価スコアに、オープンウェイト系の後継モデルが一部ベンチマークで肉薄・追い越したという事例にあたる。
なぜ重要か
GLM-5.3が示したのは、「危険になりうる能力は、新しいベースモデルの学習を経なくてもポストトレーニングの積み増しだけで想定より速く育つ」という事実だ。Z.ai自身、この性能向上を「エマージェント」(予期しない速さでの能力発達)と位置づけている。フロンティアラボが公開前に課す安全性評価は、これまで主に「新世代モデルのリリース」を単位に設計されてきたが、同じベース資産のままポストトレーニングだけで評価スコアが動くのであれば、監視の単位そのものを見直す必要が出てくる。
同時にこの一件は、攻撃的サイバー能力のガバナンスがクローズドな大手フロンティア企業だけの課題ではなくなっていることも示す。Z.aiはオープンウェイト系の開発元でありながら、能力の伸びを確認した段階で自ら重みの公開を止めた。実際に悪用可能な力(ExploitBench)ではまだフロンティアに届いていないとはいえ、公開前に立ち止まって安全性評価を挟むという振る舞い自体が、オープン・クローズドを問わず高能力モデルの出し方に共通の作法になりつつあることをうかがわせる。