Skip to main content
QUICK REVIEW

[論文レビュー] Goal-Auxiliary Actor-Critic for 6D Robotic Grasping with Point Clouds

Lirui Wang, Xiang Yu|arXiv (Cornell University)|Oct 2, 2020
Robot Manipulation and Learning参考文献 55被引用数 14
ひとこと要約

本論文では、エゴセントリックなポイントクラウドから閉ループ6次元ロボットグリッピング方策を学習するために、模倣学習とゴール予測補助学習を組み合わせた強化学習手法であるGoal-Auxiliary DDPG (GA-DDPG) を提案する。方策は連続的な6次元グリッパー姿勢行動を直接出力し、実世界のヒューマンロボットハンドオーバーで78%の成功率を達成するとともに、テーブップおよび動的環境下での未観測対象への一般化性能が向上した。

ABSTRACT

6D robotic grasping beyond top-down bin-picking scenarios is a challenging task. Previous solutions based on 6D grasp synthesis with robot motion planning usually operate in an open-loop setting, which are sensitive to grasp synthesis errors. In this work, we propose a new method for learning closed-loop control policies for 6D grasping. Our policy takes a segmented point cloud of an object from an egocentric camera as input, and outputs continuous 6D control actions of the robot gripper for grasping the object. We combine imitation learning and reinforcement learning and introduce a goal-auxiliary actor-critic algorithm for policy learning. We demonstrate that our learned policy can be integrated into a tabletop 6D grasping system and a human-robot handover system to improve the grasping performance of unseen objects. Our videos and code can be found at https://sites.google.com/view/gaddpg .

研究の動機と目的

  • 事前に合成されたグリッピングポーズに依存するオープンループ6次元グリッピング手法の限界を解消すること。
  • エゴセントリックカメラからのポイントクラウド観測のみを用いて、エンドツーエンドの閉ループ制御方策を学習すること。
  • 深層強化学習フレームワーク内で模倣学習とゴール補助学習を組み合わせることで、サンプル効率と方策一般化性能を向上させること。
  • 後向きゴールの監視を用いたファインチューニングにより、未知の対象に対する継続的学習を可能とすること。

提案手法

  • 本手法は、深層決定的方策勾配(DDPG)に基づくゴール補助アクター・クリティックフレームワークを採用し、アクターとクリティックが最終的な6次元グリッピングポーズを補助的タスクとして予測するように訓練する。
  • シミュレーション内でShapeNetオブジェクトを用いたモーションとグリッピングの統合プランナを用いて、大規模かつ一貫性のあるエキスパート軌道を生成する。
  • これらのエキスパートデータから得られるオフポリシーのデータを用いて方策を訓練し、既知のオブジェクトではエキスパートプランによるゴール予測タスクの監視を行い、未知のオブジェクトでは成功したロールアウトからのヒューリスティックゴールを用いる。
  • 状態表現は、ターゲットオブジェクトのセグメンテーション済みポイントクラウドであり、ポイントリーネットベースのエンコーダーによって3次元特徴を抽出し、方策の入力とする。
  • 行動空間は、ロボットグリッパーの相対的な6次元姿勢変換(3次元並進と3次元回転)として定義され、6次元空間における連続的制御を可能にする。
  • ポイントクラウドベースの認識とエンドツーエンド方策学習を活用することで、正確な3次元オブジェクトモデルへの依存を減らし、シミュレーションから実世界への移行を支援する。

実験結果

リサーチクエスチョン

  • RQ1ポイントクラウド観測からの模倣学習と強化学習の組み合わせによって、閉ループ6次元グリッピング方策を有効に学習できるか?
  • RQ2ゴール予測を補助タスクとして組み込むことで、6次元グリッピングにおける方策のサンプル効率と性能がどのように向上するか?
  • RQ3事前3次元モデルが存在しない未知のオブジェクトに対しても、ヒューリスティックゴールの監視を用いて一般化可能か?
  • RQ4動的状況、特に移動する対象を伴うヒューマンロボットハンドオーバーにおいて、方策はどの程度効果的か?
  • RQ5従来のオープンループグリッピング合成手法と比較して、本手法はどの程度シミュレーションから実世界へのギャップを低減できるか?

主な発見

  • 提案されたGA-DDPG手法は、10種類の未観測の家庭用オブジェクトを対象に実世界のヒューマンロボットハンドオーバー課題で78%の成功率を達成し、優れた一般化性能を示した。
  • テーブルトップ6次元グリッピングシステムにおいて、トレーニング時に見られなかった未観測オブジェクトに対しても、方策が効果的にグリッピング性能を向上させた。
  • ゴール補助学習の統合により、ヒューリスティックゴールを用いた未知オブジェクトに対する有効なファインチューニングが可能になり、方策学習が顕著に向上した。
  • ユーザースタディーの結果、参加者はロボットを滑らかで適応的かつ安全であると認識し、物体の動きへの反応性について強い賛同を示した。
  • 動的環境下でもロバストな性能を示したが、カメラの遅延(15fps)と長距離でのセンシングノイズの影響により、反応型ハンドオーバーのシナリオでは性能がわずかに低下した。
  • マグカップやペンなどの挑戦的なオブジェクトにおいて、本手法はタスク特化型ハンドオーバーシステムと同等またはそれ以上の性能を示し、多様なオブジェクト形状への高い適応性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。