Cognitionが示したのは、より賢いモデルを1つ選ぶ話ではなく、高価なモデルと安価なモデルをどう束ねるかの設計だ。Devin Fusionは、計画とレビューを担う高性能モデル(リード)と、実作業を担う低コストモデル「SWE-2」(サイドキック)を並行稼働させる。Artificial Analysisの独立測定では、Claude Fable 5.1をリードにした構成がClaude Code単体と同等の指数(62)で、1タスク$7.90対$12.36、約36%安かった。エージェントを大量に回す開発者にとっては、同じ品質を保ったままタスク単価を下げる余地が「モデル選び」ではなく「ハーネス構成」にあるという意味になる。モデル単体の賢さ競争から、複数モデルを束ねる設計の巧拙へという流れを強める事例だ。
何が起きたか
- Cognitionは、クラウド外のDevin DesktopとCLIでFusionを利用可能にした(Cognition公式ブログ)。
- Fusionはリードとサイドキックの2モデルを並行稼働させ、各自が独立した永続コンテキストを持つ。やり取りは指示書(brief)・結果・フィードバックのみ。
- Cognitionは、タスク途中でモデルを切り替えるルーティング方式ではプロンプトキャッシュが失われるため、この分離設計を採ったと説明している。これはCognition自身の見解である。
仕組み・詳細
- SWE-2はMoonshot AIのKimi K3(2.8兆パラメータ)を土台にしたモデルで、報酬は成否からコストを差し引く形(R=S−λₑC)で設計されたとCognitionは説明している。
- reasoningはmedium / high / maxの3段階。Devin Desktop・CLI・Webで利用でき、Fusionへの展開は進行中と記載されている。
数字で見る
- Artificial Analysisの比較ページでは、Devin Fusion CLIは指数62・1タスク$7.90・35.8分。
- Claude Codeとの比較では、小数で61.7対62.2、$7.90対$12.36(36%減)。「同等」は丸めた表現で、Fusionはわずかに下回る。
- Codex比較ページでのFusion CLIは9.7Mトークン・99.5ターン・キャッシュヒット率96%。
- Cognitionは、GPT-6 Astraをリードにした構成でCodex比39%のコスト減と説明している(公式ブログ。Cognition自身の数字)。
背景
注意すべきは比較対象の構成依存性だ。同じArtificial Analysisの比較ページでは、Codex単体の行が指数63・$1.04/タスクで、Fusion CLI($7.90)の方が約7.6倍高い。Claude Code比の36%減は、あくまで比較に使われた構成での結果で、「Fusionは常に安い」とは言えない。Claude Codeのreasoning設定(max+fallback)の詳細も未確認で、構成名を明記して読む必要がある。
なぜ重要か
複数モデルの協調を「切り替え」ではなく「並走する独立コンテキスト」で実現し、キャッシュ割引を維持したまま、独立機関の測定でコストと性能の両面が示された。ルーティングでは失われるキャッシュを守る設計が実測で効くかが、今後の焦点になる。
なお、SWE-2の価格・無料期間、Fusionの料金プラン、Vals AIでの評価、Sakana AIの関連発表は本稿の検証範囲では未検証で、扱っていない。