AMDとCerebrasが手を組んだのは、単なる相互協業の発表ではなく、推論処理そのものの分業体制の刷新だ。プロンプト処理(プリフィル)はAMD Heliosの高スループットが担い、トークン生成(デコード)はCerebras Wafer-Scale Engine(WSE)の超低遅延が担う——両者を「単一の分離型推論ワークフロー」として連携させ、消費電力あたりトークン数(T/s/W)で最大5倍の向上を目指すと発表した。推論ワークロードを大量に回す開発者にとっては、同じ処理をより低遅延・高スループットでこなせる選択肢が2026年後半に増えることを意味し、トークン単価やレイテンシSLAの面でインフラ選定の判断材料が広がる。これは、AI各社が計算資源の量そのものを競う段階から、GPU・専用チップを役割ごとに組み合わせて性能密度を引き出す段階へ移りつつある——推論インフラの「分離型(disaggregated)」アーキテクチャ化という大きな流れを、大手半導体2社が具体的な製品ロードマップに落とし込んだ事例だ。本当の問いは、この役割分離が汎用GPU一枚で完結させる従来の推論方式からの脱却を促し、今後の推論コスト競争における標準アーキテクチャになっていくのかという点にある。

何が起きたか

AMD(NASDAQ: AMD)とCerebras Systemsは2026年7月23日、サンフランシスコとサニーベールで開催された「Advancing AI 2026」イベントにおいて、AMD Helios rackscaleソリューションとCerebras Wafer-Scale Engineを組み合わせた分離型(disaggregated)AI推論ソリューションで技術提携を発表した。両社は、超低遅延のAI推論インフラに向けたワークロード最適化アプローチを共同で推進するとしている。

仕組み・詳細

このソリューションの核心は、推論処理を2つの工程に分けて別々のハードウェアに担わせる点にある。

  • プリフィル(プロンプト処理・大規模コンテキスト処理): AMD Heliosが高性能・高スケーラビリティのスループットエンジンとして担当する。
  • デコード(トークン生成): Cerebras WSEが、メモリ帯域幅集約的なトークン生成を超低遅延で担当する。

両者は独立した処理系ではなく、「単一の分離型推論ワークフロー」として連携動作する。プロンプト処理と応答生成という性質の異なる2つの負荷を、それぞれに適したハードウェアへ分離することで、全体としての遅延とスループットを同時に引き上げる狙いだ。

数字で見る

  • T/s/W最大5倍: 両社は、消費電力あたりトークン数(tokens per second per watt)で最大5倍の向上を見込むと発表した。ただしこれはAMD・Cerebras両社が示した目標値であり、第三者による独立検証を経た実測値ではない点に留意が必要。
  • 提供開始は2026年後半: 共同ソリューションはまずCerebras Cloud経由で、2026年後半(H2 2026)に提供開始予定。Cerebrasは自社データセンターにもAMD Heliosを展開する計画としている。

背景

AMD会長兼CEOのLisa Su氏は「AI inference is becoming one of the largest infrastructure opportunities in AI(AI推論はAIにおける最大級のインフラ機会になりつつある)」とコメント。Cerebras CEOのAndrew Feldman氏も「The demand for ultra-fast inference is growing at an unprecedented pace(超高速推論への需要はかつてない速度で伸びている)」と述べている。

今回の提携は、AI推論インフラをめぐる大手半導体企業間の資本・技術協業が相次ぐ流れの一角でもある。AMDは同時期にAnthropicとのGPU調達・出資提携も進めており、Nvidiaもエージェント向け専用CPU「Vera」を投入するなど、フロンティアラボの推論需要を取り込む動きが半導体各社で活発化している。

なぜ重要か

この提携が示すのは、推論インフラの競争軸が「GPUをどれだけ積むか」という物量の勝負から、「プリフィルとデコードをどう役割分離して組み合わせるか」という設計の勝負へ移りつつあるという構造だ。プロンプト処理と応答生成という異なる特性の負荷を専用ハードウェアに分けることで性能密度を引き出す——この分離型(disaggregated)アーキテクチャが実際の製品として市場に投入されることは、今後の推論コスト競争を評価するうえでの参照点になる。