[論文レビュー] Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation
Act3Dは、1枚のRGB-D画像と自然言語指示を入力として、連続的解像度の3次元アクションマップを予測する3次元特徴場変換器ポリシーを提案する。粗い段階から細かい段階への3次元点サンプリングと相対的位置埋め込み、およびビジョン・ランゲージ事前学習を用いることで、RLBenchで最先端の性能を達成し、カメラの視点変化に対しても堅牢に一般化し、視点変化下で74.2%の成功率を達成した。これはHiveFormerの20.4%と比較して顕著な優位性を示している。
3D perceptual representations are well suited for robot manipulation as they easily encode occlusions and simplify spatial reasoning. Many manipulation tasks require high spatial precision in end-effector pose prediction, which typically demands high-resolution 3D feature grids that are computationally expensive to process. As a result, most manipulation policies operate directly in 2D, foregoing 3D inductive biases. In this paper, we introduce Act3D, a manipulation policy transformer that represents the robot's workspace using a 3D feature field with adaptive resolutions dependent on the task at hand. The model lifts 2D pre-trained features to 3D using sensed depth, and attends to them to compute features for sampled 3D points. It samples 3D point grids in a coarse to fine manner, featurizes them using relative-position attention, and selects where to focus the next round of point sampling. In this way, it efficiently computes 3D action maps of high spatial resolution. Act3D sets a new state-of-the-art in RL-Bench, an established manipulation benchmark, where it achieves 10% absolute improvement over the previous SOTA 2D multi-view policy on 74 RLBench tasks and 22% absolute improvement with 3x less compute over the previous SOTA 3D policy. We quantify the importance of relative spatial attention, large-scale vision-language pre-trained 2D backbones, and weight tying across coarse-to-fine attentions in ablative experiments. Code and videos are available on our project website: https://act3d.github.io/.
研究の動機と目的
- 最小限のデモで多様なタスクと視点にわたるロボット操作ポリシーの一般化を図ること。
- 視点変化に弱く、オフセットを回帰する2次元マルチビュー手法の限界を克服すること。
- 1枚のRGB-Dカメラからの入力で、高精度で連続的解像度の3次元アクション予測を可能にすること。
- 3次元特徴場モデリングとビジョン・ランゲージアライメントを通じて、ゼロショット一般化と深度ノイズ・視点シフトへの耐性を向上させること。
- 多様な物体タイプと相互作用をカバーする、言語条件付きポリシーを備えた統合的フレームワークを構築すること。
提案手法
- 各点に相対的3次元位置埋め込みを用いてアテンションを行うことで、粗い段階から細かい段階への3次元点サンプリングにより、連続的解像度の特徴場として3次元シーンを表現する。
- CLIPで事前学習されたResNet50特徴を用いたビジョン・ランゲージ変換器バックボーンを採用し、自然言語指示に条件づけたアクション予測を実現する。
- 粗い段階から細かい段階へのサンプリング段階間で重みを共有し、局所的な細粒度の視覚特徴に注目することで、局所化精度を向上させる。
- 3次元空間にゴーストポイントをサンプリングすることで、空間的に適応的な計算を実現し、推論コストと性能の間で動的かつ柔軟なトレードオフを可能にする。
- アクションを3次元検出出力として予測するようにモデルを学習し、連続的3次元特徴場による無限解像度を活用することで、正確なアクション局所化を実現する。
- マルチビューの一貫性とランダムクロップなどのデータオーグメンテーションを活用して耐性を向上させる一方、ヨー回転のような有害な摂動を回避する。

実験結果
リサーチクエスチョン
- RQ1粗い段階から細かい段階へのサンプリングを備えた3次元特徴場変換器は、2次元マルチビュー回帰手法と比較して、視点変化に対する一般化性能を顕著に向上させられるか?
- RQ2相対的3次元位置埋め込みとサンプリング段階間での重み共有は、ポリシー性能と一般化にどのように影響するか?
- RQ3CLIPで事前学習された2次元視覚特徴は、マルチタスク設定におけるゼロショット成功率をどの程度向上させるか?特に言語指示が重要な状況で。
- RQ4サンプリングされるゴーストポイントの数は、推論コストとアクション予測精度のトレードオフにどのように影響するか?
- RQ51つの3次元検出ベースのポリシーは、わずかなキネスティックデモのみを用いて、液体、アーティキュレート、変形可能な物体を含む多様な操作タスクに一般化可能か?
主な発見
- Act3Dは視点変化下で74.2%の成功率を達成し、HiveFormerの20.4%と比較して相対的に24%の低下に抑えられた。これは視点変化への優れた耐性を示している。
- 重み共有を削除すると17.5%、相対的3次元位置埋め込みを削除すると42.7%の性能低下が生じ、一般化に果たすその重要性が明確に示された。
- 3段階ではなく2段階のサンプリングにすると4.5%の性能低下が生じ、完全な粗いから細かい段階への精錬の必要性が確認された。
- すべての段階でグローバルな粗い特徴に注目する代わりに、局所的な細かい特徴に注目することで、8.3%の性能向上が得られた。これは細かい段階での局所的注目が重要であることを示している。
- ゴーストポイントのサンプリング数を1,000から10,000に増加させると、性能が4.9%向上した。これは、サンプリング密度の上昇が精度向上に寄与し、コスト増加は最小限に抑えられることを示している。
- CLIPで事前学習されたResNet50特徴は、ImageNetで事前学習された特徴と比較して、マルチタスク設定で8.7%の成功率向上をもたらした。特に言語指示が重要な状況で顕著な向上が見られた。
![Figure 2: Tasks. We conduct experiments on 92 simulated tasks in RLBench [ 16 ] (only 10 shown), and 8 real-world tasks (only 5 shown).](https://ar5iv.labs.arxiv.org/html/2306.17817/assets/final_figures/tasks.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。