Moonshotが2026年7月27日、2.8兆パラメータのKimi K3について実際のモデルウェイトと技術レポートを公開した。これまでKimi K3はAPI経由でしか触れられないブラックボックスだったが、self-hosting前提での採用を検討している開発者は、実際に重みをダウンロードして自分のインフラでベンチマークし、Moonshot自身が学習・推論に使ったアテンションカーネル(FlashKDA)やMoE通信ライブラリ(MoonEP)までそのまま使ってデプロイできるようになった——採用判断に必要な検証が、提供元の説明を信じるしかない状態から、自分の手元で確かめられる状態に変わったということだ。しかも今回の公開は、Kimi K3がAnthropicの「Fable」を蒸留して作られたのではないかという疑惑が渦巻く最中に実施された。オープンウェイトの中国製モデルを巡る規制論争——モデルを検査できることを安全保障の前提に置く議論——のただ中で、実際に検査可能な重みが世に出たことは、疑惑が当事者間の言った言わないの応酬にとどまらず、第三者が実際にモデルを調べて確かめられる段階に移ったことを意味する。
何が起きたか
Moonshotは2026年7月27日、Kimi K3のフルモデルウェイトと技術レポートを公開した。Hugging Face公式モデルカードと公式GitHubリポジトリ(技術レポートPDF付き)でともに確認でき、公式X投稿・公式ブログでも同内容が告知されている。Kimi K3自体はこれに先立つ7月中旬からAPI経由で提供されていたモデルだが、今回の公開によって外部の誰もが実際の重みを直接検査・自前実行できるようになった。
仕組み・詳細
公開されたのはモデル本体だけではない。Moonshotは同時に、Kimi K3の学習・推論を支える周辺OSSスタックも3点公開している。
- FlashKDA: Kimi Delta Attention (KDA) 向けの高性能アテンションカーネル。ただし公開自体は今回が初出ではなく、2026年4月時点で先行モデルKimi Linear向けにすでに公開されていたもので、K3のために新規開発されたわけではない。既存カーネルが引き続きK3のスタックの一部として提供されている、という位置づけになる。
- MoonEP: MoE構成のエキスパート並列処理における通信を担うライブラリ。動的な冗長エキスパート配置により、ランク間のトークン負荷を均等に保つ設計。
- AgentENV: kvcache-aiと共同開発した、大規模にエージェント環境を実行するための基盤。Kimi K3のエージェント型強化学習(RL)訓練を支えるコンポーネント群として位置づけられている。
アーキテクチャ面では、Kimi K3はKimi Delta Attention (KDA) と Attention Residuals (AttnRes) を組み合わせた新設計を採用している。公式技術レポート・GitHub READMEによれば、この新アーキテクチャにより前モデルKimi K2と比べて総合的なスケーリング効率が約2.5倍向上したという。比較対象はKimi K2であり、他社モデルとの相対比較ではない点には注意が要る。
数字で見る
- 総パラメータ: 2.8兆
- MoE構成: 896人のエキスパートのうちトークンごとに16人を活性化
- アクティブパラメータ: 1,040億(104B)
- コンテキスト長: 最大1,048,576トークン(約100万)
- マルチモーダル対応: テキスト・画像・動画のネイティブ理解(ビジョンエンコーダはMoonViT-V2)
- スケーリング効率: Kimi K2比で約2.5倍(Moonshot公式技術レポート)
背景
Kimi K3は7月中旬にAPI経由で先行公開されて以降、その高い性能がAnthropicの「Fable」を蒸留した結果ではないかという疑惑を招いており、米財務省高官が制裁・エンティティリスト指定の可能性に言及する事態にまで発展していた。この疑惑については、Fableの一般提供再開からKimi K3発表までの期間が短すぎ、単純な蒸留だけでは説明がつかないとする独立系専門家の反論もすでに出ている。今回のフルウェイト公開は、こうした議論のさなかで予告されていたものが実際に実施された形になる。
なぜ重要か
self-hosting前提でKimi K3の採用を検討している開発者・研究者にとって、実際に動く重みを自分のインフラに置いて検証できるという点は実務上の意味が大きい。API越しのブラックボックスとしてではなく、Moonshotが自ら学習・推論に使ったアテンションカーネル(FlashKDA)やMoE通信ライブラリ(MoonEP)まで揃った状態で、896人中16人のエキスパートを使うMoE構成やアクティブパラメータ104Bといった仕様を、外部の第三者が自分の手元で独立に検証できるようになった。
これは、オープンウェイトの中国製モデルを巡る規制論争が渦巻くタイミングでもある。NVIDIAが主導した「オープン性こそが安全保障に資する」とする業界書簡や、Anthropicが示した「一律禁止には反対だが、蒸留の取り締まりと能力に応じた安全性テストは支持する」という立場は、いずれも「モデルを検査できること」自体を議論の前提に置いている。フルウェイトが実際に公開されたことで、Kimi K3を巡るFable蒸留疑惑は、当事者間の言った言わないの応酬にとどまらず、第三者が実際にモデルを調べて確かめられる段階に移った——次に問われるのは、その検証を誰が実際に行うかだ。