Skip to main content
QUICK REVIEW

[論文レビュー] RVT: Robotic View Transformer for 3D Object Manipulation

Ankit Goyal, Jie Xu|arXiv (Cornell University)|Jun 26, 2023
Advanced Vision and Imaging被引用数 6
ひとこと要約

RVTは、再レンダリングされた仮想ビューを用いたマルチビュー変換器を活用することで、ボクセルベースの手法を凌駆するスケーラブルでビュー中心の3次元操作フレームワークを提案する。18のRLBenchタスクにおいてPerActより26%高い成功率を達成し、学習は36倍速く、推論時も2.3倍速く動作する。また、タスクごとに約10回のデモでのみ実世界タスクに一般化可能である。

ABSTRACT

For 3D object manipulation, methods that build an explicit 3D representation perform better than those relying only on camera images. But using explicit 3D representations like voxels comes at large computing cost, adversely affecting scalability. In this work, we propose RVT, a multi-view transformer for 3D manipulation that is both scalable and accurate. Some key features of RVT are an attention mechanism to aggregate information across views and re-rendering of the camera input from virtual views around the robot workspace. In simulations, we find that a single RVT model works well across 18 RLBench tasks with 249 task variations, achieving 26% higher relative success than the existing state-of-the-art method (PerAct). It also trains 36X faster than PerAct for achieving the same performance and achieves 2.3X the inference speed of PerAct. Further, RVT can perform a variety of manipulation tasks in the real world with just a few ($\sim$10) demonstrations per task. Visual results, code, and trained model are provided at https://robotic-view-transformer.github.io/.

研究の動機と目的

  • ボクセルベースのアプローチを凌駆する性能と学習効率を両立したスケーラブルで高精度な3次元オブジェクト操作手法の開発。
  • 視覚ベースの手法の3次元推論における限界を克服するため、視覚間の情報を効果的に統合できるマルチビュー変換器の導入。
  • 再レンダリングされた仮想ビューと強固な視覚特徴学習を活用することで、最小限のデモで実世界への展開を可能にする。
  • センサーカメラ入力を再レンダリングによって変換器入力から分離することで、物理的カメラ制約に依存しない柔軟な、タスク固有のビュー選択を可能にする。

提案手法

  • RVTは、複数の再レンダリングされたビューを同時に注目することで、視覚間の空間的および意味的情報を統合するマルチビュー変換器アーキテクチャを採用している。
  • モデルはRGB-D入力を処理し、タスクに適した3次元推論を最適化した仮想視点(例:上から見たビュー、正面ビューなど)からシーンを再レンダリングする。
  • 2段階のアテンション機構を採用:まず各画像内のパッチ内でのアテンションを行い、次に全ビュー間でのクロスビューアテンションを実行することで特徴表現を強化する。
  • ネットワークはビューごとのヒートマップと特徴量を出力し、ロボットのエンドエフェクタのポーズを予測することで、3次元空間における正確な制御を可能にする。
  • 再レンダリングは微分可能レンダラを用いて実施され、エンド・トゥ・エンドの学習が可能となり、直交投影やデータオーグメンテーションの利用も可能になる。
  • 1台の物理的カメラしか利用できない状況でも、仮想ビューからの再レンダリングにより、単一カメラでの実世界展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ビュー中心の手法が、画像ベース手法のスケーラビリティを保ちつつ、SOTAのパフォーマンスを達成できるか?
  • RQ2仮想ビューからの再レンダリングは、生のセンサーカメラ入力と比較して、性能をどのように向上させるか?
  • RQ3マルチビュー変換器アーキテクチャにおける、アテンションの順序やビュー選択といった設計選択が、操作精度を最大化するにはどのようなものか?
  • RQ41つのRVTモデルが、最小限の実世界デモで多様な3次元操作タスクに一般化可能か?

主な発見

  • RVTは18のRLBenchタスク(249のタスク変種を含む)において、PerActと比較して26%高い相対的成功率を達成し、優れた一般化性能と正確性を示した。
  • RVTはPerActと比較して36倍速く学習可能であり、同じハードウェア上での学習時間を14日から10時間に短縮した。
  • RVTは推論速度がPerActの2.3倍(11.6 fps 対 4.9 fps)に達し、リアルタイム展開が可能になった。
  • 実世界実験では、スタックブロックタスクで100%の成功率、ペースタンプタスクで80%の成功率を達成し、1タスクあたり約10回のデモで実現した。
  • マーカーなしタスクでは82.5%の成功率を達成したが、点群が疎でノイズが多いマーカー関連タスクでは性能が低かった。
  • 再レンダリングされた仮想ビューの使用は、生のセンサービューと比較して顕著にパフォーマンスを向上させた。特に直交投影とデータオーグメンテーションを組み合わせた場合に顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。