Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning of Active Vision for Manipulating Objects under Occlusions

Ricson Cheng, Arpit Agarwal|arXiv (Cornell University)|Nov 20, 2018
Reinforcement Learning in Robotics参考文献 31被引用数 21
ひとこと要約

本論文は、遮蔽のあるごみだらけの環境で物体を操作するロボットエージェントのための強化学習フレームワークを提案する。オブジェクト中心の注目メカニズムとカリキュラム学習を組み合わせることで、物体の可視性を維持する能動的ビジョン方策を実現し、遮蔽下でも静的カメラのベースラインと比べて著しく優れた成功確率を達成した。

ABSTRACT

We consider artificial agents that learn to jointly control their gripperand camera in order to reinforcement learn manipulation policies in the presenceof occlusions from distractor objects. Distractors often occlude the object of in-terest and cause it to disappear from the field of view. We propose hand/eye con-trollers that learn to move the camera to keep the object within the field of viewand visible, in coordination to manipulating it to achieve the desired goal, e.g.,pushing it to a target location. We incorporate structural biases of object-centricattention within our actor-critic architectures, which our experiments suggest tobe a key for good performance. Our results further highlight the importance ofcurriculum with regards to environment difficulty. The resulting active vision /manipulation policies outperform static camera setups for a variety of clutteredenvironments.

研究の動機と目的

  • 遮蔽物が頻繁にターゲットオブジェクトを隠す cluttered 環境におけるロボット操作の課題に対処すること。
  • 操作中にターゲットオブジェクトの可視性を維持するために、グリッパーとカメラの両方の制御を協調的に学習できるエージェントを実現すること。
  • 能動的認識と行動のための、オブジェクト検出器統合型モジュラー Actor-Critic アーキテクチャの有効性を調査すること。
  • カリキュラム学習と補助報酬が、遮蔽下でのポリシーのサンプル効率と性能向上に与える影響を検討すること。
  • 能動的カメラ制御が、遮蔽環境下で静的カメラ設定に比べて優れた操作成功を達成することを実証すること。

提案手法

  • グリッパー方策は抽象状態表現上で動作するモジュラー Actor-Critic アーキテクチャを設計し、カメラ方策はオブジェクト検出器の出力を条件として用いる。
  • 事前学習済みオブジェクト検出器モジュールを統合し、リアルタイムでオブジェクトの位置と可視性を推定することで、ネットワークに構造的注目バイアスを提供する。
  • 状態抽象化機構を用いて認識と行動を分離し、グリッパー方策がタスク関連の状態情報に集中できるようにする。
  • 初期段階で遮蔽物なし環境で方策を初期化し、その後遮蔽を伴うごみだらけのシーンでファインチューニングすることで、カリキュラム学習を実装する。
  • 密度の高い操作報酬を用いてカメラ方策を学習し、オブジェクト検出のための補助可視性報酬を追加した場合の影響を評価する。
  • サンプル効率を向上させるために後向き経験再生(HER)を適用したが、結果として補助可視性報酬が性能向上に寄与しなかった。

実験結果

リサーチクエスチョン

  • RQ1ハンドとアイの制御を同時に学習することで、オブジェクトが遮蔽される環境下での操作成功が向上するか?
  • RQ2オブジェクト検出器モジュールによるオブジェクト中心の注目を組み込むことで、標準的な CNN と比較して方策性能が著しく向上するか?
  • RQ3より単純な環境からより複雑な環境へと段階的に学習を進めるカリキュラム学習が、訓練の安定性と成功確率にどの程度寄与するか?
  • RQ4補助可視性報酬を追加することで、能動的カメラ制御方策の学習が向上するか?
  • RQ5遮蔽下での操作成功という観点から、能動的カメラ制御は静的カメラ設定に比べてどの程度優れているか?

主な発見

  • 提案された能動的ビジョン方策は、干渉要因を含む環境で 71.0% ± 2.2% の成功確率を達成し、静的カメラベースライン(55.8% ± 6.6%)を著しく上回った。
  • シンプルな干渉要因でさえも、vanilla CNN ベースの Actor-Critic ネットワークは操作タスクを学習できず、構造的認識モジュールの必要性を浮き彫りにした。
  • 学習済みオブジェクト検出器を Actor-Critic アーキテクチャに統合することで、遮蔽下での操作学習が効果的に可能になった。
  • 遮蔽物なし環境から開始するカリキュラム学習は、最終的な性能を顕著に向上させ、サンプル効率におけるその重要性を示した。
  • 補助可視性報酬を追加しても性能は向上せず(68.4% ± 1.5%)、最も優れた設定(71.0% ± 2.2%)と比較してわずかに成功確率が低下した。これは、密度の高い報酬が方策学習を妨げることがある可能性を示唆している。
  • 学習済み方策の可視化結果から、エージェントが遮蔽を避けるために能動的にカメラを移動していることが確認された。例えば、オブジェクトがシリンダに押し込まれる際に追従する、または障害物を越えて上にカメラを動かすといった行動が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。