Skip to main content
QUICK REVIEW

[論文レビュー] Exploration-efficient Deep Reinforcement Learning with Demonstration Guidance for Robot Control

Ke Lin, Liang Gong|arXiv (Cornell University)|Feb 27, 2020
Reinforcement Learning in Robotics参考文献 33被引用数 6
ひとこと要約

本稿では、連続的制御タスクにおけるサンプル効率性と訓練安定性を著しく向上させる、サンプル効率性に優れた深層強化学習手法DRL-EGを提案する。本手法は、識別器とガイドネットワークを用いて、少量の専門家デモンストレーションを用いて探索を誘導する。このアプローチにより、局所最適解からの脱出が可能となり、Ant-v2 や MountainCarContinuous などのスパarsely-reward環境において、SAC や PPO、DDPGfD より優れた性能を達成する。

ABSTRACT

Although deep reinforcement learning (DRL) algorithms have made important achievements in many control tasks, they still suffer from the problems of sample inefficiency and unstable training process, which are usually caused by sparse rewards. Recently, some reinforcement learning from demonstration (RLfD) methods have shown to be promising in overcoming these problems. However, they usually require considerable demonstrations. In order to tackle these challenges, on the basis of the SAC algorithm we propose a sample efficient DRL-EG (DRL with efficient guidance) algorithm, in which a discriminator D(s) and a guider G(s) are modeled by a small number of expert demonstrations. The discriminator will determine the appropriate guidance states and the guider will guide agents to better exploration in the training phase. Empirical evaluation results from several continuous control tasks verify the effectiveness and performance improvements of our method over other RL and RLfD counterparts. Experiments results also show that DRL-EG can help the agent to escape from a local optimum.

研究の動機と目的

  • 連続的制御タスクにおける深層強化学習(DRL)のサンプル非効率性と訓練の不安定性を解消すること。
  • 効果的な探索と方策学習を阻害するスパarsely-reward環境の課題を克服すること。
  • 性能向上を維持したまま、大規模な専門家デモンストレーションへの依存度を低減すること。
  • 訓練中に局所最適解から脱出できるように、エージェントを支援すること。
  • 事前学習やリプレイバッファへの挿入に依存せずに、探索フェーズに専門家ガイダンスを統合する手法を開発すること。

提案手法

  • 状態 $s$ に対して、ガイド $G(s)$ が高品質な行動を提供できるかどうかを評価する識別器 $D(s)$ を提案する。
  • 少量の専門家デモンストレーションから学習されるガイド $G(s)$ を導入し、高報酬状態での行動提案を実現する。
  • 識別器-ガイドメカニズムをSoft Actor-Critic(SAC)フレームワークに統合し、訓練中の探索を誘導する。
  • 両方の $D(s)$ と $G(s)$ にニューラルネットワークベースのアーキテクチャを採用し、専門家トレーリングからエンドツーエンド学習を可能にする。
  • 識別器がガイドの出力に対する信頼度に基づき、ポリシー駆動の行動とガイド駆動の行動の間で動的に切り替える。
  • 最大エントロピー強化学習の原則を活用し、高報酬領域への誘導と併せて探索性を維持する。

実験結果

リサーチクエスチョン

  • RQ1少量の専門家デモンストレーションが、連続的制御タスクにおけるDRLのサンプル効率性を効果的に改善できるか?
  • RQ2識別器-ガイドメカニズムは、SAC や PPO といった標準的なDRLアルゴリズムと比較して、探索性をどのように向上させるか?
  • RQ3提案手法が、スパarsely-reward環境における局所最適解からの脱出をどの程度支援できるか?
  • RQ4ガイドド探索メカニズムは、Ant-v2 のような挑戦的な環境で訓練安定性を向上させるか?
  • RQ5最終報酬と収束速度の観点から、DRL-EGは事前学習やデモンストレーション挿入ベースラインと比較して、どの程度優れているか?

主な発見

  • DRL-EGは、Ant-v2 および MountainCarContinuous 環境において、SAC や PPO、PPO に事前学習を適用したバージョン、DDPGfD よりも優れた性能を示し、より高い最終報酬を達成した。
  • Ant-v2 環境では、DRL-EGは専門家デモンストレーションと同等の性能を達成したが、SAC や DDPGfD は訓練が不安定で収束が悪かった。
  • Ant-v2 環境では、4つのランダムシードのうち3つでDRL-EGが局所最適解からの脱出に成功したのに対し、SAC はその場に留まった。
  • Hopper や HalfCheetah では、DRL-EGはSACに比べてわずかな向上を示したが、これはガイドドメカニズムが、スパarsely-reward または高複雑性の設定で最も効果的であることを示している。
  • DRL-EGは、特にAnt-v2 のような非定常環境において、訓練安定性が向上した。ここでは、小さなポリシー変更が以前は性能の崩壊を引き起こしていた。
  • 識別器-ガイドメカニズムにより、報酬がスパースな場合に標準的なDRL手法が無効になる状況でも、効果的な探索が可能になった。MountainCarContinuous タスクでは、SAC や PPO が報酬がゼロに留まったが、DRL-EGは効果的に探索を実行した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。