NVIDIA・UC Berkeley・Stanford・Panasonic・La Sapienza University(ItalAI)の研究チームが示したのは、ロボットに触覚センサーを足せば足すほど賢くなるわけではないという逆説だ。彼らが発表したロボット操作システム「T-Rex」は、既存の視覚言語行動モデル(VLA)π0.5に触覚信号を単純に追加すると、素のπ0.5より性能がむしろ悪化することを実測で示した。代わりにT-Rexが採用したのは、低頻度の視覚計画ストリームと300Hz(約3.3ミリ秒周期)で回る高頻度の触覚微調整ストリームを分離する設計で、12の実世界操作タスク全てで最強ベースラインを平均30%以上上回った。
ロボットのマニピュレーションモデルを設計する開発者にとって、この結果が意味するのは「センサーを増やす」より前に「そのセンサーをどの時間スケールの制御ループに載せるか」を設計する方が優先度が高いということだ。触覚のようにミリ秒単位で反応すべき情報を、数百ミリ秒単位でしか更新されない視覚計画の入力にそのまま混ぜ込むと、情報が薄まるかノイズとして扱われ性能を下げる。これは本ページが繰り返し観測してきた「容量やモダリティを闇雲に増やすより、アーキテクチャ設計そのものが性能を左右する」という、フロンティアモデル開発全体に通底する傾向——スパースMoEでの効率的なエキスパート設計や、必要な情報だけを絞り込むハイブリッドアテンション機構が、単純な規模拡大より効くという構図——が、言語モデルの外側である身体性を伴うロボット操作の領域でも同じ形で成り立つことを示す一事例だ。
本当の問いは、T-Rexが触覚をうまく使えたかどうかではない。ロボットは今後、視覚・触覚に加えて力覚・音声・接触履歴など、扱うモダリティをさらに増やしていく方向にある。その各段階で「単純に入力を追加する」設計を選ぶか、「モダリティごとの時間スケールに合わせて処理ループを再設計する」設計を選ぶかで、性能が上がるか下がるかが分かれるとT-Rexの結果は示唆している。センサーを増やすことと、賢くなることは同じではない。
何が起きたか
NVIDIA・UC Berkeley・Stanford・Panasonic・La Sapienza University(ItalAI)の研究チームが、視覚計画とミリ秒単位の触覚微調整を分離したロボット操作システム「T-Rex」を発表した。元の報道は「NVIDIAとUC Berkeleyの研究チーム」と紹介していたが、実際にはStanford・Panasonic・La Sapienza University(ItalAI)も共著機関に名を連ねる多機関共同研究であり、この点は訂正が必要だ。
T-Rexは12の実世界マニピュレーションタスク(繊細な力加減や変形物体の操作を要するもの)で、macro-average成功率65%を記録した。これは最強ベースライン(EgoScale、35%)を+30ポイント上回る数値で、比較対象の全12タスクでこの優位性が確認されている。あわせて研究チームは、既存の事前学習済みVLAモデルπ0.5に触覚信号を単純に追加すると、素のπ0.5より性能スコアが下がることも実測で示した。
仕組み・詳細
T-Rexのアーキテクチャは、論文上は「variable-rate Mixture-of-Transformers(MoT)」と呼ばれる。ニュースレター等で使われがちな「MoE(Mixture-of-Experts)型」という表現は概念的には近いが、論文の正式な学術用語ではない。構成されるexpertはlatent expert・action expert・tactile expertの3つで、方策(policy)を低頻度の視覚運動計画(visuomotor planning)ストリームと高頻度の触覚微調整(tactile refinement)ストリームに分割する。
高頻度側は300Hzで動く低レベル制御スレッドで、約3.3ミリ秒周期に相当する。触覚expertからの高速ストリームは、チャンク内のオフセット{0, 4, 8, 12}で頻繁にトリガーされる設計になっており、視覚計画がまだ更新されていない間も触覚由来の微調整だけを高頻度で反映できる。
ハードウェアは固定ベースのbimanualロボットDexmate Vega-1で、22自由度のSharpa Wave製デクスタラスハンドを両手に搭載する。各ハンドは5本の指先すべてに触覚センサーを備える構成だ。学習データは100時間のテレオペレーション、200以上の日常物体、22の再利用可能なモーター・プリミティブから構成され、このうち約50時間分がオープンソースとして公開されている。なお一部の報道にある「207個の物体」という具体的な数値は、一次ソースでは確認できていない——論文・プロジェクトページとも一貫して「200以上」という概数表現のみが確認できる。
数字で見る
- 65% vs 35% — T-Rexのmacro-average成功率(最強ベースラインEgoScale比、+30ポイント、12タスク全てで確認)
- 300Hz(約3.3ミリ秒周期) — 触覚微調整を担う高頻度低レベル制御スレッドの動作周波数
- 100時間 — 事前学習に使われたテレオペレーションデータの総量(うち約50時間分をオープンソース化)
- 200以上 — 学習データに含まれる日常物体の種類数(一次ソースで確認できるのはこの概数まで)
- 22種類 — 再利用可能なモーター・プリミティブの数
背景
物理AI・ロボット操作の分野では、視覚言語行動モデル(VLA)にどのモダリティをどう組み込むかが技術的な焦点になっている。T-Rexが示した「触覚を素朴に追加すると性能が下がる」という結果は、モダリティを増やすこと自体が目的化しがちな開発の流れに対する具体的な反証データになる。あわせて、この研究がNVIDIA・UC Berkeley単独ではなくStanford・Panasonic・La Sapienza University(ItalAI)を含む多機関共同研究である点は、「〇〇社と〇〇大学が発表」という二者間フレーミングの見出しが、実際の共同研究体制を単純化しがちであることも示している。
なぜ重要か
ロボット操作モデルを設計・実装する開発者にとって、T-Rexの結果は「まずセンサーを増やし、後から統合方法を考える」という順序の危うさを具体的な数値で裏付ける。触覚のように高頻度な反応が必要な情報は、視覚計画と同じ処理ループに混ぜるのではなく、周波数帯を分離した専用ストリームとして設計しなければ、追加した分だけ性能を落としかねない。
より大きな流れで見ると、この結果は言語モデルの世界で繰り返し確認されてきた「規模やモダリティを単純に増やすより、アーキテクチャ設計そのものが性能を左右する」という原則が、身体性を伴うロボット操作という全く異なる領域でも成り立つことを示す一事例だ。ロボットが今後、力覚・音声・接触履歴といった新しいモダリティを取り込んでいく過程で、「入力を足す」設計から「モダリティごとの時間スケールに応じて制御ループを再設計する」設計への転換が問われることになる。