Skip to main content
QUICK REVIEW

[論文レビュー] Active Perception and Representation for Robotic Manipulation

Youssef Zaky, Mandakini Paruthi|arXiv (Cornell University)|Mar 15, 2020
Robot Manipulation and Learning参考文献 42被引用数 4
ひとこと要約

本論文は、固定カメラベースラインと比較して、8%高い grasping 成功率と4倍以上のサンプル効率を達成する、眼とハンドの制御を統合したアクティブな認知と表現(APR)フレームワークを提案する。このフレームワークは、最適な視点選択のための固定化ポリシーと6-DoFの操作のための grasping ポリシーの二重ポリシー方式を採用している。対象となるタスクにおいて、対数極座標変換、生成的クエリネットワーク(GQN)による自己教師付き表現学習、スパarsな報酬からの共同ポリシー学習を組み合わせることで、シミュレーション環境で優れた性能を発揮する。

ABSTRACT

The vast majority of visual animals actively control their eyes, heads, and/or bodies to direct their gaze toward different parts of their environment. In contrast, recent applications of reinforcement learning in robotic manipulation employ cameras as passive sensors. These are carefully placed to view a scene from a fixed pose. Active perception allows animals to gather the most relevant information about the world and focus their computational resources where needed. It also enables them to view objects from different distances and viewpoints, providing a rich visual experience from which to learn abstract representations of the environment. Inspired by the primate visual-motor system, we present a framework that leverages the benefits of active perception to accomplish manipulation tasks. Our agent uses viewpoint changes to localize objects, to learn state representations in a self-supervised manner, and to perform goal-directed actions. We apply our model to a simulated grasping task with a 6-DoF action space. Compared to its passive, fixed-camera counterpart, the active model achieves 8% better performance in targeted grasping. Compared to vanilla deep Q-learning algorithms, our model is at least four times more sample-efficient, highlighting the benefits of both active perception and representation learning.

研究の動機と目的

  • 深く強化学習を用いたロボット操作における被動的ビジョンの非効率性を是正するため、霊長類の視覚系にインspiredされたアクティブな認知を組み込むこと。
  • 複数の視点からの観測から、生の視覚的観測を用いて効率的かつ自己教師付きでシーン表現を学習すること。
  • 単一の報酬信号を用いて、固定化と grasping ポリシーを共同で学習させ、サンプル効率とタスクパフォーマンスを向上させること。
  • 4-DoFのトップダウン制御を超えて、6-DoFの高精度な grasping を可能にし、より現実的な物体操作を実現すること。
  • アクティブな視点制御と空間可変的視覚サンプリングが、表現品質と下流のポリシー学習をどのように向上させるかを示すこと。

提案手法

  • 2番目の6-DoFのマニピュレータが、ワristマウントされたカメラを制御し、タスクに関連する物体に注目するための視点を能動的に変更する。
  • 画像は、霊長類の中心視野視覚系を模倣するために、対数極座標変換を用いて処理される。
  • マルチモーダルエンコーダーが、2つの視点からの視覚的およびプロピリオセプティブな入力を統合し、統合されたシーン表現を形成する。
  • 生成的クエリネットワーク(GQN)を用いて、多視点観測から分離可能で低次元のシーン表現を学習する。
  • 共通の報酬関数を用いて、固定化と grasping 行動の両方を学習する統合ポリシーネットワークを構築し、スパarsな報酬からのエンドツーエンド学習を可能にする。
  • モデルは単一の報酬信号を用いて両方のポリシーを学習し、固定化が grasping ポリシーが関連する物体に向けられるようにする。

実験結果

リサーチクエスチョン

  • RQ1アクティブな視点制御は、視覚ベースのロボット操作におけるサンプル効率とパフォーマンスを向上させるか?
  • RQ2アクティブな認知からの自己教師付き多視点表現学習は、被動的観測と比較して、ポリシー学習をどのように向上させるか?
  • RQ3統一されたポリシー枠組みは、単一の報酬信号を用いて、固定化と grasping 行動を同時に学習可能か?
  • RQ4対数極座標変換による空間可変的視覚サンプリングは、表現品質とタスクパフォーマンスをどの程度向上させるか?
  • RQ56-DoFの grasping タスクにおいて、アクティブな認知は固定カメラベースラインと比較してどのように優れているか?

主な発見

  • アクティブな認知モデルは、70,000回未満の grasping 尝試でテストオブジェクトで85%の成功率を達成し、被動的固定カメラベースラインを8%上回った。
  • APRモデルは、バニラのディープQラーニングアルゴリズムと比較して、少なくとも4倍のサンプル効率の向上を示し、アクティブな認知と表現学習の利点を裏付けた。
  • トレーニングの進行に伴い表現品質が向上し、GQNが生成する中央オブジェクトの画像が次第に鮮明になる傾向が観察され、パフォーマンスの向上と相関した。
  • モデルは、オブジェクトの幾何学的形状とシーンの文脈に基づいて、適応的にグリッパーの姿勢を制御する6-DoFの grasping ポリシーを学習した。
  • 固定化ポリシーは、タスクに関連するオブジェクトに注目する能力を学習し、結果として grasping ポリシーの目的を暗黙的に定義した。
  • アクティブな認知と自己教師付き表現学習の組み合わせが、サンプル効率の向上の主因であった。両者とも表現学習を用いても、被動的モデルを上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。