Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning with Experience Ranking Convolutional Neural Network for Robot Manipulator

Van‐Dinh Nguyen, Hung Manh La|arXiv (Cornell University)|Sep 16, 2018
Reinforcement Learning in Robotics参考文献 21被引用数 4
ひとこと要約

本論文では、ロボット操作タスクにおけるDDPG + HER強化学習の性能を向上させるために、報酬が高く、品質の高い経験をリプレイに優先的に取り込むことで学習を加速する経験ランク付け畳み込みニューラルネットワーク(ER-CNN)を提案する。視覚的およびタスク関連の特徴に基づいてエピソードをランク付けする事前学習済みCNNを用いることで、学習の収束を早め、最終的な性能を向上させ、ドア押しタスクでは100%の成功率を達成し、複雑なタスクでは学習エピソード数を最大66%まで削減した。

ABSTRACT

Supervised learning, more specifically Convolutional Neural Networks (CNN), has surpassed human ability in some visual recognition tasks such as detection of traffic signs, faces and handwritten numbers. On the other hand, even state-of-the-art reinforcement learning (RL) methods have difficulties in environments with sparse and binary rewards. They requires manually shaping reward functions, which might be challenging to come up with. These tasks, however, are trivial to human. One of the reasons that human are better learners in these tasks is that we are embedded with much prior knowledge of the world. These knowledge might be either embedded in our genes or learned from imitation - a type of supervised learning. For that reason, the best way to narrow the gap between machine and human learning ability should be to mimic how we learn so well in various tasks by a combination of RL and supervised learning. Our method, which integrates Deep Deterministic Policy Gradients and Hindsight Experience Replay (RL method specifically dealing with sparse rewards) with an experience ranking CNN, provides a significant speedup over the learning curve on simulated robotics tasks. Experience ranking allows high-reward transitions to be replayed more frequently, and therefore help learn more efficiently. Our proposed approach can also speed up learning in any other tasks that provide additional information for experience ranking.

研究の動機と目的

  • 報酬が疎でバイナリな強化学習の課題に対処し、標準的手法が学習信号の欠如により困難に直面する状況を改善すること。
  • 全経験を同等に扱う固定リプレイ戦略に欠けるHindsight Experience Replay(HER)の限界を克服すること。
  • 経験選択のための学習済みでタスク固有の評価メカニズムを導入することで、サンプル効率と学習速度を向上させること。
  • 事前学習済みCNNを用いた事前知識の統合が、ロボットタスクにおける方策学習の加速と安定化に顕著に寄与することを示すこと。

提案手法

  • ロボット操作タスクにおける報酬の疎さに対処するため、Deep Deterministic Policy Gradient(DDPG)とHindsight Experience Replay(HER)を統合する。
  • 視覚的およびタスク関連の特徴に基づいてエピソード全体を評価・ランク付けする別個の事前学習済み畳み込みニューラルネットワーク(ER-CNN)を訓練する。
  • ER-CNNの出力スコアを用いて、エピソードがリプレイバッファに格納されるかどうかを決定し、高ランクの遷移のみを保持する。
  • 低ランクの経験(例:ランクが4より大きいもの)を破棄するフィルタリング機構を実装し、低品質なデータが学習を劣化させないよう防止する。
  • ドア押し、フェッチスライド、フェッチプッシュ、フェッチピックアンドプレースの4つのMuJoCoロボットタスクに、ランク付けされた経験リプレイを適用する。
  • ER-CNNの入力として、物体までの距離、ドアハンドルの有無、ヒンジの角度などの画像ベースの特徴を用いてエピソード評価を行う。

実験結果

リサーチクエスチョン

  • RQ1学習済み外部CNNベースのランク付けシステムは、報酬が疎なロボット操作タスクにおけるDDPG + HERのサンプル効率を向上させることができるか?
  • RQ2視覚的およびタスク固有の特徴に基づく経験ランク付けは、均一またはTD誤差ベースのリプレイ戦略と比較して、学習速度と最終的性能において優れているか?
  • RQ3事前学習済みの視覚モデルを用いることで、複雑なロボット制御タスクにおける収束に必要なエピソード数をどの程度削減できるか?
  • RQ4ER-CNNを用いた低品質経験のフィルタリングは、標準的なHERと比較して、より安定的で高い最終的成功確率を達成するか?
  • RQ5提案手法は、テスト済みの環境を超えて多様なロボット操作タスクに一般化可能か?

主な発見

  • ER-CNN手法はドア押しタスクで中央値の成功確率が100%に達し、元のDDPG + HERは収束時に高い精度を維持できなかった。
  • フェッチプッシュタスク(FetchPush-v1)では、提案手法が元のDDPG + HERと比較して収束に必要なエピソード数を半分に削減した。
  • より複雑なフェッチピックアンドプレースタスク(FetchPick&Place-v1)では、必要な学習エピソード数を元のDDPG + HERベースラインの3分の1にまで削減した。
  • ER-CNNベースのランク付けシステムは、学習のロバスト性を向上させ、4つのシミュレーテッドタスクすべてで収束が速く、性能が安定した。
  • 実世界で学習されたER-CNN(正答率80.2%)を用いても、元のDDPG + HERよりも学習速度と最終的性能が優れていた。
  • 結果から、視覚的に情報が多く、品質の高い経験を優先することで、報酬が疎な環境下でもより効率的かつ安定した方策学習が可能になることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。