Dyna Roboticsが示したのは、ロボット基盤モデルのアーキテクチャの優劣ではなく、事前学習に使う人間動画データの規模がそのまま実世界での汎化性能に直結するという関係だ。世界行動モデル(WAM)Dyna-2は100万時間超——170年分に相当する連続した人間の一人称視点(egocentric)動画で事前学習され、初めて訪れる客先の稼働現場でのゼロショット展開において87%のタスク成功率を達成した。社内評価では前世代Dyna-1・Dyna-2とも100%近くまで達し差がほとんどないのに対し、同一の学習後処理予算のもとで初見の現場に限るとDyna-1が46%、Dyna-2が87%と41ポイントの差が開く——アーキテクチャの比較条件を揃えてなお生じたこの差は、大規模な人間動画による事前学習そのものが持つ効果を裏付けている。
ロボットを新しい現場に導入する開発者にとって、この数字は現場ごとの追加データ収集やファインチューニングに頼らずとも本番品質に近い成功率が最初から出ることを意味する。さらにDyna Roboticsは動画生成器を1ステップで推論できる「生徒モデル」に蒸留する新しいパイプラインを開発し、H100 1基上で3秒・3視点のマニピュレーション動画の生成時間を10,203ミリ秒から110ミリ秒へ、約90分の1に圧縮した。動画生成ベースの世界モデルはこれまでリアルタイムの行動生成ループに乗せるには遅すぎたが、110ミリ秒という速度域はその制約を実質的に外す。LLMの世界で「データを増やせば汎化する」というスケーリング則がモデルの賢さを押し上げてきたのと同じ論理が、身体性を伴うロボティクスの領域でも具体的な数値とともに再現され始めている——フロンティアモデルの競争を駆動してきた「スケールが勝つ」という戦略が、言語の外側の物理世界のAIにも広がりつつある動きの一例だ。
本当の問いは、Dyna-2がDyna-1より賢いアルゴリズムを積んでいるかどうかではない。両モデルは学習後処理の予算を揃えた条件で比較されており、慣れた社内環境では性能差がほぼ消える。差が開くのは初見の現場という汎化が問われる場面に限られる。だとすれば、ロボティクス基盤モデルの競争軸は精緻なアーキテクチャ設計そのものよりも、どれだけの規模と質の人間動画データを集められるかという、データ収集パイプラインの規模へと移り始めている。
何が起きたか
Dyna Roboticsは新しいロボット基盤モデルDyna-2を発表した。同社はDyna-2を、未来の動画と未来の行動を単一の生成モデルで統合的に(jointly)、またはそれぞれ独立に(separately)ノイズ除去できる「世界行動モデル(World-Action Model, WAM)」と位置づけている。Dyna-2は100万時間超の人間の一人称視点(egocentric)動画——約170年分の連続した覚醒時間に相当する規模——で事前学習された。
前世代のDyna-1は、Qwen3-VL-4Bから初期化されたmixture-of-transformersアーキテクチャで行動予測を行う、VLA(Vision-Language-Action)型のモデルである。Dyna RoboticsはWAMとVLAを公平に比較するため、Dyna-1とDyna-2を学習条件・学習後処理予算を揃えて訓練し比較した。その結果、社内(in house)評価ではどちらもほぼ100%に近い本番品質のパス率で差がなかった一方、初めて訪れる客先の稼働現場(on site)でのゼロショット展開では、Dyna-1が46%、Dyna-2が87%と41ポイントの差が生じた。
仕組み・詳細
WAMというアーキテクチャの特徴は、動画生成と行動予測を分離せず単一の生成モデルに統合している点にある。Dyna-2は将来の映像と将来の行動系列を、状況に応じて同時に、あるいは個別にノイズ除去(denoise)して生成できる。この設計により、Dyna-2は行動そのものだけでなく大量の人間の一人称視点動画という、行動ラベルの付いていない映像データからも学習できる。100万時間超という事前学習データの規模は、この「行動ラベル不要の映像から学べる」性質があって初めて実現している。
もう一つの技術的な柱が、動画生成の推論を高速化する新しい蒸留パイプラインだ。Dyna Roboticsは、Dyna-2の動画生成器を1ステップで推論を完了できる「生徒モデル」へ蒸留する手法を開発した。これにより、H100 1基での3秒・3視点のマニピュレーション動画生成にかかる時間は10,203ミリ秒から110ミリ秒へ、約90倍短縮された。
数字で見る
- 100万時間超(約170年分) — Dyna-2の事前学習に使われた人間の一人称視点動画データの規模
- 87% vs 46% — 初見の客先稼働現場でのゼロショット展開タスク成功率(Dyna-2 vs Dyna-1、同一の学習後処理予算下、41ポイント差)
- ほぼ100% — 社内(in house)評価でのタスク成功率(Dyna-1・Dyna-2ともほぼ差なし)
- 約90倍(10,203ミリ秒→110ミリ秒) — 1ステップ蒸留パイプライン導入後の動画生成推論時間の短縮(H100 1基、3秒・3視点のマニピュレーション動画)
背景
大規模言語モデルの開発では、学習データと計算資源の規模を増やすほど性能が予測可能な形で向上するという「スケーリング則」が、フロンティアモデル間の競争を駆動する基本戦略として定着してきた。Dyna-2の結果は、この「データ規模が性能を押し上げる」という関係が、テキストではなく身体性を伴う実世界のロボット操作という全く異なる領域でも、具体的な性能数値とともに再現され得ることを示す一事例である。
Dyna-1とDyna-2の比較は、学習後処理の予算を揃えたうえで行われており、社内の慣れた環境では両者の性能差はほぼ消える。差が際立って現れるのは、学習時に見ていない客先の現場という、汎化性能が直接問われる条件に限られる。
なぜ重要か
ロボットを新しい現場に展開する事業者にとって、87%対46%という差は、現場ごとの追加データ収集やファインチューニングという運用コストを大きく左右する数字だ。加えて、動画生成の推論コストが約90分の1に圧縮されたことで、これまで応答速度の面で実用域に届かなかった動画生成ベースの世界モデルが、リアルタイムの行動生成ループに乗せられる速度域に入った。
より大きな構図で見ると、Dyna-2が示したのは、学習後処理条件を揃えてなお生じた性能差の源泉が、大規模な人間動画による事前学習という「データの規模」そのものにあるという点だ。ロボティクス基盤モデルの競争軸が、個々のアーキテクチャの精緻さよりも、どれだけの規模と質の人間動画データを集められるかというデータ収集能力そのものへと移り始めている可能性を、この結果は具体的な数値で裏付けている。