Thinking Machines Labが公開した新モデル「Inkling」の要点は、パラメータの大きさではなく効率だ。総パラメータ9750億・アクティブ410億のMoE構成に、システムメッセージで思考量を指定できる「controllable thinking effort」を組み合わせ、Nvidia Nemotron 3 UltraとTerminal Bench 2.1(エージェント型ターミナル/コーディングタスク)で同等の性能を約3分の1のトークン数で達成したという。エージェントを本番で大量に回す開発者にとって、トークン数はそのままレイテンシとAPIコストに直結する——同じ精度をより少ないトークンで出せるモデルは、タスクあたりの実行コストを直接押し下げる。単体モデルの賢さを競うフェーズから、同じ性能をどれだけ少ないトークンで出せるかという効率競争へ——エージェント運用のコスト構造そのものが、フロンティアモデル競争の評価軸として重みを増しつつある。

何が起きたか

Thinking Machines Labは、オープンウェイトのMoE(Mixture-of-Experts)トランスフォーマー「Inkling」を公開した。総パラメータ9750億・アクティブ410億で、テキスト・画像・音声・動画にまたがる45兆トークンで事前学習されている。フルウェイトはThinking MachinesのTinkerプラットフォーム上で公開当日からファインチューニング可能で、Hugging Faceでも重みが配布されている。

同時に、軽量版「Inkling-Small」(アクティブ120億・総パラメータ2760億のMoE)のプレビューも発表された。ただし公式発表では「現在テストを完了させている最中で、その作業が終わり次第フルウェイトを公開する」と明記されており、Inkling-Smallは本体のInklingと同時にすぐ使えるわけではない。パラメータ数自体は正しいが、可用性については訂正が必要な点だ。

仕組み・詳細

Inklingの特徴は「controllable thinking effort」だ。システムメッセージで思考量のレベルを指定でき、性能とトークン効率のバランスを利用側で調整できるとThinking Machines Labは説明している。

この機能が効いた結果として示されているのが、Terminal Bench 2.1(エージェント型のターミナル操作・コーディングタスクを評価するベンチマーク)でのスコアだ。Inklingは、Nvidia Nemotron 3 Ultraと同等の性能を「おおむね3分の1のトークン数」("roughly a third of the tokens")で達成したと公式ブログは述べている。

数字で見る

項目 数値
総パラメータ数 9750億(975B)
アクティブパラメータ数 410億(41B)
事前学習トークン数 45兆トークン(テキスト・画像・音声・動画)
Terminal Bench 2.1(対Nemotron 3 Ultra) 同等性能を約3分の1のトークン数で達成
Inkling-Small アクティブパラメータ 120億(12B、総パラメータ2760億・プレビューのみ)

なぜ重要か

Inklingが示すのは、モデルの総パラメータを増やすこと自体は目的ではなく、思考量を調整可能にしてトークン消費を絞り込む設計が、同等性能への到達コストを下げるという方向性だ。エージェントを本番で反復実行する開発者にとって、Terminal Bench 2.1のようなエージェント型タスクで「同等性能を3分の1のトークンで」出せるモデルは、月間のAPIコストや応答レイテンシに直接跳ね返る。加えてフルウェイトがTinker上で即ファインチューニング可能・Hugging Faceでも配布されているため、自前で用途特化のエージェントを構築したいチームにとっては、性能だけでなく調整の自由度も選定材料になる。

一方でInkling-Smallはプレビュー段階にとどまり、フルウェイト公開時期は「テスト完了後」としか示されていない。低コストデプロイ向けの選択肢を検討する際は、本体のInklingと軽量版Inkling-Smallの可用性を混同しないことが重要だ。