Z.aiは、8月14日発表の「GLM-5.3」について、価格体系と仕様を確定させた形で公式ドキュメントに整理した。コーディング特化の月額サブスクリプション「GLM Coding Plan」は18〜168ドル、API価格は100万トークンあたり入力$1.40・出力$4.40。同時に自社公開のベンチマーク表を見ると、脆弱性を実際に悪用する力を問うExploitBenchでGLM-5.3は54.4%を記録し、同じオープンウェイト系のKimi K3(32.2%)を大きく引き離した一方、アクセスが制限されたAnthropic「Mythos 5」(78.0%)・OpenAI「GPT-5.6 Sol」(76.5%)の水準にはまだ届いていない。コーディングエージェントの運用コストを抑えたい開発者にとっては、月額固定か従量課金かを選べる二本立ての価格体系が、具体的な採用判断材料として使える段階に入った。より大きな構図で見れば、オープンウェイト×低価格×コーディング特化という組み合わせが商用スケールで価格まで確定した一方、その最も懸念される能力(脆弱性の実悪用)はなお審査済み・非公開のフロンティアモデルに一歩及ばない——安さで先行するオープン系と、実力で先行する審査済み系の差が、これからどこまで縮むのかが次の焦点になる。

何が起きたか

  • Z.aiは公式開発者ドキュメントで、GLM-5.3のアーキテクチャ・入出力仕様・価格体系を確定した形で公開した。
  • アーキテクチャはMoEトランスフォーマー。Artificial Analysisの公式モデルページによれば総パラメータ753B(うちアクティブ40B)。
  • 入出力は最大1Mトークン入力・最大128Kトークン出力に対応。推論レベルはlow/high/maxの3段階を備え、function calling・structured output・streaming・context cachingにも対応する。
  • 価格体系は2本立て。月額サブスクリプション「GLM Coding Plan」はLite $18・Pro $80・Max $168。API従量課金は100万トークンあたり入力$1.40・キャッシュ入力$0.26・出力$4.40。
  • 重みのダウンロード公開は、発表から約2週間後・安全性評価と堅牢化の完了後を予定している。

数字で見る: サイバー能力ベンチマークの精査

Z.ai公式のベンチマーク表を見ると、GLM-5.3のサイバー能力は「発見」と「悪用」で明暗が分かれる。

  • CyberGym(脆弱性の発見): GLM-5.3 84.5%(前世代GLM-5.2は77.2%)/Claude Mythos 5 83.8%/GPT-5.6 Sol 83.6%。GLM-5.3が比較対象中で最高値。
  • ExploitBench(脆弱性の悪用): GLM-5.3 54.4%(GLM-5.2の24.4%から倍増)/Kimi K3 32.2%/Claude Mythos 5 78.0%/GPT-5.6 Sol 76.5%。GLM-5.3はKimi K3を大きく上回るが、Mythos 5・GPT-5.6 Solには依然届かない。

なお、「CyberGym・ExploitBenchとも前世代比2倍以上に急伸した」という形で語られることがあるが、これは不正確だ。実際に2倍以上伸びたのはExploitBenchのみ(24.4%→54.4%、約2.23倍)で、CyberGymは77.2%→84.5%という緩やかな上昇(約1.09倍)にとどまる。両ベンチマークを一括りに「2倍以上」と表現するのは誇張にあたる。

コーディング性能の比較にも注意点がある。GLM-5.3(max reasoning)は「Code Bench」で34.5%・約75,000トークンを記録したが、しばしば併記されるClaude Opus 4.8の29.5%・120,000トークンは、Z.ai公式表では"High"効果レベルの数値であり、GLM-5.3のMax値と同一条件で比較されたものではない。GLM-5.3自身のHigh値は31.4%・約50,000トークンで別に存在する。Claude Fable 5(max reasoning)は39.5%(出力トークン数は非開示)。効果レベル(low/high/max)を揃えずに横並びで語ると、実際より不利・有利な印象を与えかねない。

背景

比較対象の一つ「Claude Mythos 5」は、Anthropicがサイバーセキュリティ・生命科学分野向けに公開範囲を制限している実在のモデルで、二重用途リスクの大きさから一般公開されていない。もう一つの比較対象Kimi K3は、英国AI安全機関(UK AISI)と米国機関(CAISI)による2026年7月の共同評価で、ExploitBench型の任意コード実行(ACE)を41サンプル中0件しか達成できなかったと報告されている(最もサイバー能力の高いモデル群は平均20/41件)。評価軸そのものはZ.ai表のタスク達成率とは異なるが、Kimi K3が他モデルより低位にあるという方向性は概ね一致する。

なぜ重要か

GLM-5.3の価格・仕様の確定は、単なるスペック公開ではない。月額18ドルから使えるコーディングプランと、100万トークンあたり数ドル台のAPI従量課金という価格設計は、Z.aiがこのモデルを実験的な公開ではなく、開発者の日常的なコーディング業務に広く食い込ませる意図で出していることを示す。一方でそのモデルは、最も懸念されるサイバー能力(脆弱性の実悪用)において、同じオープンウェイト系のKimi K3を大きく引き離しながらも、アクセスが制限された審査済みモデルの水準には届いていない。

つまり現時点の構図は、「安く・広く使えるモデル」と「能力は高いが入手が制限されたモデル」が、能力面でまだきれいに分離している状態だ。この分離が保たれている間は、危険な能力へのアクセス制御という発想が機能する余地がある。しかし、オープンウェイト系のExploitBenchスコアが前世代比で倍増したという事実(GLM-5.2の24.4%→GLM-5.3の54.4%)は、その分離が固定的なものではなく、ポストトレーニングの積み増しだけで縮み得ることも同時に示している。安価に広く配布されるモデルの実悪用能力が、審査済みモデルの水準にどこまで、どれだけの速さで近づくか——それが次に問われる論点になる。