[論文レビュー] 3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
3D Diffuser Actor は、3D パーミッション表現と 3D 相対自己注意機構を活用して、反復的にエンドエフェクタの姿勢予測をノイズ除去する拡散ベースのロボット方策を提案する。この手法は、RLBench においてマルチビュー設定で 18.1% の絶対的向上、シングルビュー設定で 13.1% の向上を達成し、CALVIN ではゼロショット一般化性能が 7% の相対的向上を示す。また、少数の現実世界のデモンストレーションからも効果的に一般化可能である。
Diffusion policies are conditional diffusion models that learn robot action distributions conditioned on the robot and environment state. They have recently shown to outperform both deterministic and alternative action distribution learning formulations. 3D robot policies use 3D scene feature representations aggregated from a single or multiple camera views using sensed depth. They have shown to generalize better than their 2D counterparts across camera viewpoints. We unify these two lines of work and present 3D Diffuser Actor, a neural policy equipped with a novel 3D denoising transformer that fuses information from the 3D visual scene, a language instruction and proprioception to predict the noise in noised 3D robot pose trajectories. 3D Diffuser Actor sets a new state-of-the-art on RLBench with an absolute performance gain of 18.1% over the current SOTA on a multi-view setup and an absolute gain of 13.1% on a single-view setup. On the CALVIN benchmark, it improves over the current SOTA by a 9% relative increase. It also learns to control a robot manipulator in the real world from a handful of demonstrations. Through thorough comparisons with the current SOTA policies and ablations of our model, we show 3D Diffuser Actor's design choices dramatically outperform 2D representations, regression and classification objectives, absolute attentions, and holistic non-tokenized 3D scene embeddings.
研究の動機と目的
- 3D パーミッション表現と拡散方策を組み合わせることで、マルチタスク 3D ロボット操作における一般化性能を向上させること。
- 2D ベースの方策や決定的アクションヘッドの限界を克服するため、マルチモーダルで条件付きな拡散モデルを用いてアクション分布をモデル化すること。
- 3D パーミッション特徴抽出と 3D 相対自己注意機構を用いて、カメラの視点に依存しない一般化と未知の環境への適応を可能にすること。
- 3D 対応の反復的ノイズ除去方策を用いて、少数の人のデモンストレーションから現実世界への強力な転送を実現すること。
- 3D トークン化と 3D 相対自己注意機構といったアーキテクチャ的要素が、一般化性能と性能にどの程度寄与しているかをアブレーションスタディにより検証すること。
提案手法
- モデルは、ビジョンエンコーダーを用いてマルチビュー RGB-D 観測を 2D イメージ特徴トークンに符号化する。
- 2D 特徴トークンは深度情報を利用して 3D 空間に持ち上げられ、環境とロボットのエンドエフェクタを表す 3D パーミッション特徴トークンを形成する。
- 3D 相対位置自己注意を備えたトランスフォーマーが、3D パーミッション特徴トークン、言語指示埋め込み、ノイズの多い姿勢推定値を処理し、3D 並進と回転の誤差を予測する。
- 方策は反復的ノイズ除去を用いる:初期にノイズの多い姿勢から始め、拡散プロセスにおけるノイズ予測を繰り返し行い、エンドエフェクタの軌道を段階的に改善する。
- モデルは言語指示に条件付けられ、エンドエフェクタの姿勢履歴を短時間保持することで、長時間にわたるマルチステップタスク実行を支援する。
- 姿勢予測はスパースに生成される(キーポーズ)、これにより推論が効率的になり、BiRRT などのモーションプランナと互換性が保たれる。
実験結果
リサーチクエスチョン
- RQ13D パーミッション表現と拡散ベースのアクションモデリングを組み合わせることで、マルチタスク 3D ロボット操作におけるゼロショット一般化性能が向上するか?
- RQ22D や非相対的自己注意と比較して、3D 相対自己注意は視覚的運動方策学習における空間的推論と等長性をどの程度向上させるか?
- RQ33D パーミッション特徴抽出は、カメラの視点や未知の環境間での一般化をどの程度向上させるか?
- RQ43D パーミッション表現に条件付けられた拡散方策は、少数の現実世界デモンストレーションから効果的に一般化できるか?
- RQ53D トークン化や反復的ノイズ除去といったアーキテクチャ的要素の中で、性能と頑健性に最も寄与するのはどれか?
主な発見
- 3D Diffuser Actor は、マルチビュー設定下で RLBench において先行 SOTA よりも 18.1% の絶対的向上を達成し、シングルビュー設定では 13.1% の向上を示した。
- CALVIN ベンチマークでは、ゼロショットの未知シーン一般化性能が向上し、平均して 0.2 個のタスクを追加で完了させた。これは先行 SOTA よりも 7% の相対的向上である。
- モデルは現実世界のタスクに対しても効果的に一般化し、12 の多様な操作タスクにおいて、1タスクあたり 15 デモンストレーションでのみ高い成功確率を達成した。
- アブレーションスタディにより、3D パーミッション特徴抽出と 3D 相対自己注意が性能に不可欠であることが確認され、両者とも一般化性能を顕著に向上させた。
- 1 枚の GPU で 1 推論あたり 600 ms で実行可能であり、キーポーズのスパース生成により推論が効率的であることが示された。また、平均して 3.27 個のタスクをチェーンで正常に完了できる長時間タスクをサポートした。
- 言語指示への強い条件付けが性能を顕著に向上させ、特に長時間にわたるマルチタスク設定において顕著であり、アブレーションスタディでもその有効性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。