Skip to main content
QUICK REVIEW

[論文レビュー] Grasping in the Wild:Learning 6DoF Closed-Loop Grasping from Low-Cost Demonstrations

Shuran Song, Andy Zeng|arXiv (Cornell University)|Dec 9, 2019
Robot Manipulation and Learning参考文献 41被引用数 9
ひとこと要約

本論文では、キッチンやオフィスなどの非構造的で現実の環境において、多様な6自由度(6DoF)の把持動作のデモを収集できる低コストのハンドヘルドデバイスを提示する。このデバイスにより、6DoFのクローズドループ把持のためのエンドツーエンドの深層強化学習ポリシーの学習が可能になる。行動-ビュー基盤のレンダリングを用いて将来の状態をシミュレートし、学習された価値関数により最適な行動を選択することで、静的シーンでは92%、動的シーン(移動する物体を含む)では88%の成功を達成する。

ABSTRACT

Intelligent manipulation benefits from the capacity to flexibly control an end-effector with high degrees of freedom (DoF) and dynamically react to the environment. However, due to the challenges of collecting effective training data and learning efficiently, most grasping algorithms today are limited to top-down movements and open-loop execution. In this work, we propose a new low-cost hardware interface for collecting grasping demonstrations by people in diverse environments. Leveraging this data, we show that it is possible to train a robust end-to-end 6DoF closed-loop grasping model with reinforcement learning that transfers to real robots. A key aspect of our grasping model is that it uses "action-view" based rendering to simulate future states with respect to different possible actions. By evaluating these states using a learned value function (Q-function), our method is able to better select corresponding actions that maximize total rewards (i.e., grasping success). Our final grasping system is able to achieve reliable 6DoF closed-loop grasping of novel objects across various scene configurations, as well as dynamic scenes with moving objects.

研究の動機と目的

  • 本番の環境で多様な6DoF把持デモを収集する課題に対処し、頑健な操作ポリシーの学習を可能にする。
  • 低コストの現実世界の人体デモデータを用いて、6DoFのクローズドループ把持ポリシーをエンドツーエンドで学習可能にする。
  • ロボット内での試行錯誤に頼らず、多様な人体デモデータで事前学習することで、学習効率と一般化性能を向上させる。
  • 行動-ビュー基盤のレンダリングを用いた視覚的前向きモデルを開発し、より良い行動選択のための将来状態のシミュレーションを可能にする。

提案手法

  • 非構造的で現実の環境(例:キッチンやオフィス)において、低コストのハンドヘルドRGB-Dグリッパー機器を用いて6DoF把持デモを収集する。
  • 人体による使用中に記録されたRGB-D動画から、古典的手法による視覚追跡アルゴリズムを用いて6DoF把持軌道を回復する。
  • グリッパー中心の視覚的観測を、将来の報酬の期待値にマップする価値関数を深層ニューラルネットワークでモデル化する。
  • 行動-ビュー基盤のレンダリングにより、各候補行動に対するグリッパーのカメラが捉える画像をシミュレートし、将来の状態の予測を可能にする。
  • ポリシーは学習された価値関数を用いて、これらのシミュレートされた状態を評価し、期待累積報酬を最大化する行動をクローズドループで選択する。
  • モデルは人体デモデータで事前学習され、その後、実ロボットデータで微調整されることで、性能と一般化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1低コストのデバイスを用いて収集された多様な現実世界の6DoF把持デモは、エンドツーエンドの6DoF把持ポリシーのサンプル効率と性能を向上させるか?
  • RQ2行動-ビュー基盤のレンダリングは、6DoFのクローズドループ把持制御における将来状態のシミュレーションにどの程度有効か?
  • RQ3人体デモデータで事前学習することで、実ロボットでの自己教師付き試行錯誤に比べ、収束が速くなり、一般化性能が向上するか?
  • RQ4学習された価値関数と行動-ビュー基盤のレンダリングを組み合わせることで、移動する物体を含む動的シーンでも6DoFの把持が安定して可能になるか?
  • RQ5人体デモの多様性が、新しい物体や新しいシーン構成に対するポリシーの一般化にどの程度寄与するか?

主な発見

  • 本システムは静的シーンで92%、動的シーン(移動する物体を含む)で88%の把持成功率を達成し、先行研究の最良手法を上回る。
  • 人体デモデータで事前学習することで、ロボット内での試行錯誤から学習を開始する場合と比較して、学習が早く進み、最終的な性能も高い。
  • 新規の物体や複雑な構成(例:壁から横方向に把持する、傾斜したビンからの把持)に対しても、良好な一般化性能を示す。
  • 実ロボットデータでの微調整により、さまざまなシーン構成で平均して約18%の性能向上が達成された。
  • 行動-ビュー基盤のレンダリングの活用により、将来の視覚的状態をシミュレートし、期待報酬を最大化する行動選択が可能となり、効果的なクローズドループ制御が実現された。
  • 現実世界で収集された多様な人体デモは、限られたロボットが収集するデータと比較して、ポリシーの一般化性能とロバスト性を顕著に向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。