Cognitionが示したのは、より賢いモデルを1つ選ぶ話ではなく、高価なモデルと安価なモデルをどう束ねるかの設計だ。Devin Fusionは、計画とレビューを担う高性能モデル(リード)と、実作業を担う低コストモデル「SWE-2」(サイドキック)を並行稼働させる。Artificial Analysisの独立測定では、Claude Fable 5.1をリードにした構成がClaude Code単体と同等の指数(62)で、1タスク$7.90対$12.36、約36%安かった。エージェントを大量に回す開発者にとっては、同じ品質を保ったままタスク単価を下げる余地が「モデル選び」ではなく「ハーネス構成」にあるという意味になる。モデル単体の賢さ競争から、複数モデルを束ねる設計の巧拙へという流れを強める事例だ。

何が起きたか

  • Cognitionは、クラウド外のDevin DesktopとCLIでFusionを利用可能にした(Cognition公式ブログ)。
  • Fusionはリードとサイドキックの2モデルを並行稼働させ、各自が独立した永続コンテキストを持つ。やり取りは指示書(brief)・結果・フィードバックのみ。
  • Cognitionは、タスク途中でモデルを切り替えるルーティング方式ではプロンプトキャッシュが失われるため、この分離設計を採ったと説明している。これはCognition自身の見解である。

仕組み・詳細

  • SWE-2はMoonshot AIのKimi K3(2.8兆パラメータ)を土台にしたモデルで、報酬は成否からコストを差し引く形(R=S−λₑC)で設計されたとCognitionは説明している。
  • reasoningはmedium / high / maxの3段階。Devin Desktop・CLI・Webで利用でき、Fusionへの展開は進行中と記載されている。

数字で見る

  • Artificial Analysisの比較ページでは、Devin Fusion CLIは指数62・1タスク$7.90・35.8分。
  • Claude Codeとの比較では、小数で61.7対62.2、$7.90対$12.36(36%減)。「同等」は丸めた表現で、Fusionはわずかに下回る。
  • Codex比較ページでのFusion CLIは9.7Mトークン・99.5ターン・キャッシュヒット率96%。
  • Cognitionは、GPT-6 Astraをリードにした構成でCodex比39%のコスト減と説明している(公式ブログ。Cognition自身の数字)。

背景

注意すべきは比較対象の構成依存性だ。同じArtificial Analysisの比較ページでは、Codex単体の行が指数63・$1.04/タスクで、Fusion CLI($7.90)の方が約7.6倍高い。Claude Code比の36%減は、あくまで比較に使われた構成での結果で、「Fusionは常に安い」とは言えない。Claude Codeのreasoning設定(max+fallback)の詳細も未確認で、構成名を明記して読む必要がある。

なぜ重要か

複数モデルの協調を「切り替え」ではなく「並走する独立コンテキスト」で実現し、キャッシュ割引を維持したまま、独立機関の測定でコストと性能の両面が示された。ルーティングでは失われるキャッシュを守る設計が実測で効くかが、今後の焦点になる。

なお、SWE-2の価格・無料期間、Fusionの料金プラン、Vals AIでの評価、Sakana AIの関連発表は本稿の検証範囲では未検証で、扱っていない。