Skip to main content
QUICK REVIEW

[論文レビュー] Curiosity-Driven Multi-Criteria Hindsight Experience Replay

John B. Lanier, Stephen McAleer|arXiv (Cornell University)|Jun 9, 2019
Psychological and Educational Research Studies参考文献 39被引用数 11
ひとこと要約

本論文は、好奇心駆動型探索、課程学習、およびマルチ基準の後向き経験リプレイ(HER)を組み合わせた、人間の示唆なしに疎な報酬環境下でシミュレーション上のブロック積み上げタスクを解くための新しい強化学習フレームワークを提案する。本手法は、内在的好奇心とHERのみを用いて、2つ以上のブロックを積み上げする初の成功例であり、段階的報酬下では4ブロック積み上げで79%の成功率、2値報酬下では3ブロック積み上げで95%の成功率を達成した。

ABSTRACT

Dealing with sparse rewards is a longstanding challenge in reinforcement learning. The recent use of hindsight methods have achieved success on a variety of sparse-reward tasks, but they fail on complex tasks such as stacking multiple blocks with a robot arm in simulation. Curiosity-driven exploration using the prediction error of a learned dynamics model as an intrinsic reward has been shown to be effective for exploring a number of sparse-reward environments. We present a method that combines hindsight with curiosity-driven exploration and curriculum learning in order to solve the challenging sparse-reward block stacking task. We are the first to stack more than two blocks using only sparse reward without human demonstrations.

研究の動機と目的

  • 標準の強化学習が、探索不足と疎な報酬のため失敗する、マルチブロック積み上げのような複雑な疎な報酬のロボット操作タスクを学習するという課題に対処する。
  • ランダムな探索では容易に到達できない目標を持つマルチ基準環境において、標準的な後向き経験リプレイ(HER)の限界を克服する。
  • 内在的好奇心と構造的な課程、およびマルチ基準HERを組み合わせることで、高次元で疎な報酬の環境においても、サンプル効率の良い学習を可能にする手法を導入する。
  • 好奇心、課程、およびマルチ基準HERの統合が、人間の示唆なしに最も挑戦的なブロック積み上げタスクを解くために不可欠であることを実証する。

提案手法

  • 予測誤差として内在的好奇心報酬を計算するため、学習されたダイナミクスモデルを用いることで、エージェントが新しい状態遷移を探索するよう促進する。
  • 好奇心駆動型探索と標準ポリシーのロールアウトを、別々のネットワーク(πc と πr)を用いてオフポリシーの方法で組み合わせ、経験リプレイにより両方のデータストリームを混合する。
  • 複数の部分的目標(例:個々のブロックの位置)に基づいて遷移を再ラベルするマルチ基準の後向き経験リプレイ機構を実装し、マルチ基準タスクにおけるサンプル効率を向上させる。
  • 3段階の課程(1ブロック積み上げ、2ブロック積み上げ、3または4ブロック積み上げ)を設計し、段階的なスキル習得を可能にする。
  • 訓練中にパラメータ空間のノイズとアクションのノイズを適用することで、探索性とポリシーの汎化性能を向上させる。
  • DDPGにHERを統合し、好奇心と課程学習を組み合わせることで、複雑度が増すタスクにわたる探索と活用のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1好奇心駆動型探索を、後向き経験リプレイと組み合わせることで、人間の示唆なしに疎な報酬のロボット操作タスクを解くことができるか?
  • RQ2マルチ基準HERは、ブロック積み上げのようなマルチゴール環境において、どのようにサンプル効率と学習性能を向上させるか?
  • RQ3課程学習は、複数のブロックを積み上げるような複雑で階層的なタスクを学習する能力をどの程度向上させるか?
  • RQ4好奇心、課程、およびマルチ基準HERの相対的寄与度は、最も挑戦的なブロック積み上げタスクを解くためにどの程度か?
  • RQ5これらの技術の組み合わせは、従来の手法が失敗する2つ以上のブロックを2値(疎)報酬で積み上げることを可能にするか?

主な発見

  • 提案手法は、2値報酬下での3ブロック積み上げタスクにおいて95%の成功率を達成したが、ヴァニラな DDPG+HER や他のベースライン手法ではこのタスクを解くことに失敗した。
  • 段階的報酬下では、4ブロック積み上げで79%の成功率を達成し、より高い複雑度へのスケーラビリティを示した。
  • 2値報酬下での3ブロック積み上げタスクにおいて、好奇心駆動型探索が不可欠であった。これなしでは進展がなかった。
  • マルチ基準HERはサンプル効率を顕著に向上させ、3ブロックおよび4ブロック積み上げタスクの解消に不可欠であった。
  • 課程学習は不可欠であった。課程の初期段階を経ずに訓練したいかなる手法でも、ターゲットタスクで成功しなかった。
  • 好奇心、課程、およびマルチ基準HERの3要素の組み合わせが、最も挑戦的なブロック積み上げ環境を解くために必要不可欠であった。単一の要素だけでは十分ではなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。