2026年4月から7月にかけて、Tencent Hy3・DeepSeek-V4・GLM-5.2・LongCat-2.0という4つの中国発オープンモデルが相次いで公開・刷新された。いずれも数千億パラメータ級のMoE構成で、コンテキスト長1M前後を掲げる点が共通する。

何が起きたか

Tencentは2026年4月23日にHy3のプレビュー版をGitHubで公開し、7月6日に正式版を発表した。DeepSeekは4月24日にDeepSeek-V4-ProとDeepSeek-V4-Flashを発表、Zhipu系のGLM-5.2はHugging Faceのモデルカードが6月17日付で公開された(発表日は情報源により6/13・6/16・6/17と表記ゆれがある)。Meituanは1.6兆パラメータのLongCat-2.0をGitHubで公開した。

仕組み・詳細

各モデルの総パラメータ・活性化パラメータ・コンテキスト長・ライセンスは以下の通り。

モデル 総パラメータ/活性化 コンテキスト長 ライセンス
Tencent Hy3(プレビュー) 295B/21B(MoE、192エキスパート・top-8活性化) 256K Tencent Hy Community License Agreement
DeepSeek-V4-Pro 1.6T/49B 1M(全DeepSeek公式サービスの既定) MIT
DeepSeek-V4-Flash 284B/13B 1M 同モデルファミリー
GLM-5.2 753B(総) 1M MIT(地域制限なし)
LongCat-2.0 1.6T/約480億 1Mネイティブ対応 MIT

DeepSeek-V4-ProはCompressed Sparse AttentionとHeavily Compressed Attentionのハイブリッド構成に加え、Manifold-Constrained Hyper-ConnectionsとMuon optimizerを採用し、32兆トークン超で学習された(arXiv:2606.19348、2026-04-26提出)。GLM-5.2はIndexShare機構により「1MコンテキストでトークンあたりのFLOPsを2.9倍削減」するとzai-orgのモデルカードは説明する(4層ごとにインデクサを共有)。LongCat-2.0はLongCat Sparse Attention(Streaming-aware Indexing・Cross-Layer Indexing・Hierarchical Indexingの3要素)と3段階のMulti-Token Prediction、135BのN-gram Embeddingパラメータを持ち、GPU・NPUの両方に対応する。

数字で見る

公開されているベンチマークのうち、複数モデルで共通する指標を比較する。

モデル Terminal-Bench 2.1 SWE-bench Pro
GLM-5.2 81.0 62.1(GLM-5.1の58.4から改善)
LongCat-2.0 70.8 59.5
Claude Opus 4.8(参考・GLM-5.2側の記載) 85.0 —

GLM-5.2はHumanity's Last Exam 40.5・HLE with Tools 54.7・AIME 2026 99.2・GPQA-Diamond 91.2も記録している。LongCat-2.0はFORTE 73.2・IFEval 90.0・GPQA-diamond 88.9を記録し、「millions of accelerator-days across more than 35 trillion tokens」の学習でNVIDIA製GPUを使用していないと公式GitHubは説明する。Tencent Hy3の正式版は「プレビュー開始時からの平均日次トークン消費量がtwenty-fold(20倍)増加した」としている。

背景

Hy3プレビュー版はKimi-K2・DeepSeek-V3・GLM-4.5との比較でMMLU 87.42・MMLU-Pro 65.76・SuperGPQA 51.60・MBPP-plus 78.71・GSM8K 95.37・MATH 76.28を記録していた。正式版はTencentの各製品(WorkBuddy・CodeBuddy・Yuanbao・Marvis・ima)に統合され、Tencent Cloud TokenHub API、OpenRouter・Hermes・Kilo・Cline・OpenClaw・OpenCode・Cherry Studioへの展開に加え、Hugging Face・ModelScopeでも公開されている。DeepSeekは旧モデルdeepseek-chat・deepseek-reasonerを2026年7月24日以降に完全廃止すると予告し、1Mコンテキストを全公式サービスの既定にした。

なぜ重要か

4モデルとも数千億パラメータ級のMoE構成とコンテキスト長1M前後を掲げ、GLM-5.2はFrontierSWEで「Opus 4.8に1%差まで接近」と自己申告している。ただし測定条件(比較対象モデル・評価環境)は情報源ごとに異なり、単一指標の横並び比較には注意が必要である。LongCat-2.0のMITライセンス表記と重み公開状況の詳細は本稿執筆時点で確認しきれておらず、GLM-5.2の発表日も情報源により表記ゆれがある。