Z.aiは、自社モデルGLM-5.3を「Infra Agent」としてインフラ構築そのものに投入し、10万基超の中国製AIアクセラレータ上でGLM-5.3-Flashの本番推論基盤を2週間足らずで立ち上げた。Infra Agentが実際に手を下したのは、KDAカーネルのContext Parallelism経路に潜んでいた数値精度のバグ修正や、Pythonの並行処理関数がGIL(グローバルインタプリタロック)を解放し損ねていたボトルネックの解消、decodeカーネルの1.71倍高速化——いずれも専門のインフラエンジニアが数週間がかりで詰めるような領域だ。新型アクセラレータの立ち上げではソフトウェアスタックの未成熟がボトルネックになりやすいとされてきたが、その穴を人手のインフラチームでなくAIエージェントが埋められることを、スループット約3倍化という具体的な数字で示した。目標設定・境界設定・本番リスクの判断は最後まで人間エンジニアの手に残ったが、裏を返せば人間に残った仕事は「何を最適化させ、どこまでを任せるか」を決めることと、リスクを伴う変更をレビューすることだけに絞られつつある——AIに自社インフラの構築・最適化をどこまで委ねられるかという、フロンティア各社が現在進行形で試している問いに対する、具体的な到達点の一つだ。
何が起きたか
Z.aiは自社ブログで、GLM-5.3搭載の「Infra Agent」を用いてGLM-5.3-Flashの本番推論基盤を構築した経緯を公開した。舞台となったのは10万基超の中国製AIアクセラレータで構成されるクラスタで、GLM-5.3-Flashは初期のモデル適応から本番対応に至るまで2週間足らずで到達したという。現在、GLM-5.3-Flashの全ての本番推論はこのシステム上で稼働している。
仕組み・詳細
Infra Agentと人間エンジニアの役割分担は明確に線引きされている。Z.ai自身の説明によれば、目標設定・境界設定・リスク評価は一貫して人間エンジニアの責任として残り、エンジニアは数値的な意味論・並行処理の挙動・本番リスクを伴う重要な変更のレビューを担当した。一方でInfra Agent自身は、仮説の提案・変更の実装・実験の実行を担った。
具体的にInfra Agentが特定・修正した問題として、Z.aiは3つの事例を挙げている。1つ目は、KDAカーネルのContext Parallelism(CP)経路に存在した数値精度の問題の修正。2つ目は、intranode_dispatchとintranode_combineという関数がいずれもPythonのGILを明示的に解放していなかったことによるボトルネックの解消。3つ目は、decodeカーネルをバージョン2比で1.71倍高速化したことだ。こうした密なフィードバックとカーネル修正、システムレベルの最適化を積み重ねた結果、初期のベースラインと比べてエンドツーエンドのスループットは最終的に約3倍まで高まった。
数字で見る
- 10万基超: GLM-5.3-Flashの本番推論を支える中国製AIアクセラレータの規模
- 2週間未満: 初期モデル適応から本番対応までInfra Agentが要した期間
- 約3倍: 初期ベースライン比のエンドツーエンドスループット改善
- 1.71倍: decodeカーネルのバージョン2比の高速化率
背景
AIモデル自身に自社の推論・学習インフラの構築や最適化を担わせる動きは、Z.ai固有の取り組みではない。フロンティア各社は2026年に入り、モデルが自社の運用基盤そのものの改善に関わる事例を相次いで公表しており、GPUカーネルの自律的な書き換えや、推論チップの設計・カーネル最適化へのモデル活用が報告されている。Z.aiの今回の事例は、この流れに「中国製の非NVIDIA系アクセラレータ」という条件を重ねた具体例にあたる。
なぜ重要か
Infra Agentが担った作業の中身——カーネルの数値精度バグ修正、並行処理のボトルネック解消、実行速度の最適化——は、いずれも高い専門性を要するインフラエンジニアリングの仕事であり、単なる自動化スクリプトの範疇を超える。中国製アクセラレータでNVIDIA以外の選択肢を検討するチームにとって、立ち上げ期間の長さの多くはハードウェア性能そのものよりソフトウェアスタックの未成熟に起因するとされてきた。今回の事例は、その領域をAIエージェントが埋められる可能性を、2週間・スループット3倍化という具体的な数字とともに示した点で、チップ選定の判断材料を広げる。
もう一つの読みどころは、人間に残った役割の狭さだ。Z.aiは目標設定・境界設定・リスク評価を人間エンジニアの責任として明記する一方、仮説立案から実装、実験実行まではInfra Agentに委ねている。フロンティア各社がAIにどこまで自社インフラの構築・改善を委任できるかを探る競争の中で、「人間が握り続ける最後の領域は何か」という問いに対する現時点での一つの答えがここにある。
なお、本件を「再帰的自己改善(RSI)の具体的な実例」と紹介する向きもあるが、Z.ai自身の説明はより慎重だ。同社は記事内で「我々はまだ再帰的自己改善には到達していない」「まだそこには到達していないが、その初期の形態がすでに現れつつある」と明言しており、記事タイトル自体も「Toward Recursive Self-Improvement(再帰的自己改善へ向けて)」という留保つきの表現を採っている。今回の事例は、RSIが達成された証拠としてではなく、その手前でAIが実際に何を代替できるようになったかを測る具体的なマイルストーンとして読むのが正確だ。