AlibabaとDeepSeekが同じ8月に見せたのは、モデルの「大きさ」を競う発表ではない。Alibaba Qwenチームの「Qwen3.8-27B」は単一GPUでも動く27Bの高密度モデルでありながら、コーディングエージェント系ベンチマークSWE-bench Proで61.7を記録した。DeepSeekの「DeepSeek-V4-Flash」は総284B・活性化13BのMoE構成で、100万トークンの長文脈を扱いながら推論FLOPsを前世代比27%まで圧縮したと報告している。開発者にとっての意味は明快だ——コーディングやブラウザ操作といったエージェントタスクを、フロンティア級クラウドAPIに払い続けなくても、手元のGPU一枚か大幅に下がった推論コストでこなせる選択肢が増えたということだ。推論コストの高騰がたびたび語られる中、勝負どころは「モデルの大きさ」から「同じ性能をどれだけ軽い計算で出すか」という効率設計へ移りつつある。だとすれば次に問われるのは、フロンティアラボが前提にする大規模計算資源への集中投資が、こうした効率型モデルの追い上げにどこまで優位性を保てるか、という点だ。

何が起きたか

Alibaba Qwenチームは2026年8月、270億パラメータの高密度(dense)マルチモーダルモデル「Qwen3.8-27B」をApache 2.0ライセンスで公開した。ネイティブのコンテキスト長は262,144トークンで、最大100万トークンまで拡張できる。公式モデルカードによれば、SWE-bench Pro(エージェント型コーディング)61.7・LiveCodeBench v6 90.3・OSWorld-Verified(コンピュータ操作)84.3・WebArena-Verified(ブラウザ操作)64.8という、コーディングからGUI操作にまたがるエージェント系ベンチマークで高いスコアを記録している。

一方DeepSeekは技術レポートで、総284Bパラメータ・活性化13BパラメータのMixture-of-Experts(MoE)モデル「DeepSeek-V4-Flash」を発表した。100万トークンのコンテキスト長に対応し、100万トークンコンテキストにおける推論FLOPsは前世代DeepSeek-V3.2比で27%まで削減されたと報告している。

仕組み・詳細

両モデルは設計思想が対照的だ。Qwen3.8-27Bは「高密度(dense)」——全パラメータが常に計算に使われる構成でありながら、パラメータ数自体を27Bという単一GPUで扱える規模に絞り込んでいる。対してDeepSeek-V4-Flashは「MoE(Mixture-of-Experts)」——総パラメータは284Bと大きいが、実際の推論で活性化するのは13Bのみに抑える構成だ。総容量を大きく保ちながら計算コストを切り詰める設計であり、これが「前世代比で推論FLOPsを27%まで削減」という効率化の中身になる。

アプローチは違っても、両社が向かっている先は同じに見える——「大きなクラウド専用モデル」でなければ出せなかった性能域に、単一GPUで動く高密度モデルや、活性化パラメータを絞ったMoEモデルが到達しつつあるという点だ。Artificial Analysis Intelligence Indexでは、Qwen3.8-27B(xhigh設定)が52ポイントを記録し、同等サイズのオープンウェイトモデルの中央値(9ポイント)を大きく上回ったと同社は評価している(2026年8月25日時点の計測値。ベンチマーク順位は計測基盤の更新で変動しうる点に留意)。

数字で見る

モデル 設計方式 パラメータ規模 コンテキスト長 主なベンチマーク
Qwen3.8-27B 高密度(Dense) 27B(全パラメータ活性化) ネイティブ262,144/最大100万トークン SWE-bench Pro 61.7、LiveCodeBench v6 90.3、OSWorld-Verified 84.3、WebArena-Verified 64.8
DeepSeek-V4-Flash MoE 総284B/活性化13B 最大100万トークン 推論FLOPsを前世代(V3.2)比27%まで削減(100万トークンコンテキスト時)

背景

なお、DeepSeek-V4-Flashの総パラメータ数については、公式技術レポート(arXiv)が明記する284Bという数値と、Hugging Face上の関連モデルページで見られる別の表記との間に不一致が報告されている。0731版などのチェックポイントで構成が変わった可能性、あるいは表示側の誤りの可能性のいずれも確定していない。本記事の数値は一次ソースである技術レポート記載の284Bに統一している。

両モデルとも、クラウドAPIに依存せずローカル・低コストで動かせる高性能エージェントモデルとして2026年8月に相次いで公開された。単一GPUで動く高密度モデル(Qwen3.8-27B)と、総容量を保ちつつ活性化計算量を切り詰めるMoEモデル(DeepSeek-V4-Flash)という異なるアプローチが、同じタイミングでエージェント系ベンチマークの高スコアという同じ結果にたどり着いている。

なぜ重要か

これまでSWE-bench ProやOSWorldのようなエージェント系ベンチマークで高スコアを出すには、フロンティア級のクラウドAPIに頼るのが実質的な前提だった。Qwen3.8-27BとDeepSeek-V4-Flashは、単一GPUで動く規模、あるいは活性化パラメータを大きく絞った構成でも同種のタスクをこなせることを具体的な数値で示した。開発者にとっては、コーディングエージェントやブラウザ操作エージェントを組む際に、クラウドAPIの継続課金に縛られず、手元のハードウェアや大幅に下がった推論コストで運用できる選択肢が広がったことを意味する。推論コストの上昇が業界で繰り返し話題になる中、こうした効率型モデルの立ち上がりは、モデル選定の基準を「性能の絶対値」から「性能あたりの計算コスト」へと少しずつ動かしつつある。