Skip to main content
QUICK REVIEW

[논문 리뷰] Exploration-efficient Deep Reinforcement Learning with Demonstration Guidance for Robot Control

Ke Lin, Liang Gong|arXiv (Cornell University)|2020. 02. 27.
Reinforcement Learning in Robotics참고 문헌 33인용 수 6
한 줄 요약

이 논문은 연속 제어 작업에서 샘플 효율성을 크게 향상시키고 훈련 안정성을 개선하기 위해 소량의 전문가 시범을 사용하여 탐색을 유도하는 DRL-EG라는 샘플 효율적인 딥 강화 학습 방법을 제안한다. 이 방법은 식별기와 가이드 네트워크를 통해 탐색을 안내하며, Ant-v2와 MountainCarContinuous와 같은 희박 보상 환경에서 SAC, PPO, DDPGfD를 능가한다. 에이전트가 국소 최적점에서 벗어나는 데에도 기여한다.

ABSTRACT

Although deep reinforcement learning (DRL) algorithms have made important achievements in many control tasks, they still suffer from the problems of sample inefficiency and unstable training process, which are usually caused by sparse rewards. Recently, some reinforcement learning from demonstration (RLfD) methods have shown to be promising in overcoming these problems. However, they usually require considerable demonstrations. In order to tackle these challenges, on the basis of the SAC algorithm we propose a sample efficient DRL-EG (DRL with efficient guidance) algorithm, in which a discriminator D(s) and a guider G(s) are modeled by a small number of expert demonstrations. The discriminator will determine the appropriate guidance states and the guider will guide agents to better exploration in the training phase. Empirical evaluation results from several continuous control tasks verify the effectiveness and performance improvements of our method over other RL and RLfD counterparts. Experiments results also show that DRL-EG can help the agent to escape from a local optimum.

연구 동기 및 목표

  • 연속 제어 작업을 위한 딥 강화 학습(DRL)에서 샘플 비효율성과 불안정한 훈련 문제를 해결한다.
  • 효과적인 탐색과 정책 학습을 방해하는 희박 보상 문제를 극복한다.
  • 성능 향상을 유지하면서 대규모 전문가 시범에 대한 의존도를 줄인다.
  • 훈련 중 국소 최적점에서 벗어나도록 에이전트를 가능하게 한다.
  • 사전 훈련이나 재현 버퍼 주입만으로는 이루어지지 않는 탐색 단계에 전문가 가이드를 통합하는 방법을 개발한다.

제안 방법

  • 상태 $s$ 에 대해 가이드 $G(s)$ 가 고품질 액션을 제공할 수 있는지 평가하는 식별기 $D(s)$ 를 제안한다.
  • 소량의 전문가 시범에서 학습된 가이드 $G(s)$ 를 도입하여 고보상 상태에서 액션을 제안한다.
  • 식별기-가이드 메커니즘을 소프트 액터-크리틱(SAC) 프레임워크에 통합하여 훈련 중 탐색을 안내한다.
  • 식별기 $D(s)$ 와 가이드 $G(s)$ 에 모두 신경망 기반 아키텍처를 사용하여 전문 트레이젝터리에서 엔드 투 엔드 학습을 가능하게 한다.
  • 식별기가 가이드의 출력에 대한 신뢰도를 기반으로 정책 기반 액션과 가이드 기반 액션 사이를 동적으로 전환한다.
  • 최대 엔트로피 강화 학습 원리를 활용하여 탐색을 유지하면서도 고보상 영역으로 유도한다.

실험 결과

연구 질문

  • RQ1소량의 전문가 시범이 연속 제어 작업을 위한 DRL에서 샘플 효율성을 효과적으로 향상시킬 수 있는가?
  • RQ2식별기-가이드 메커니즘이 SAC 및 PPO와 같은 표준 DRL 알고리즘에 비해 탐색을 어떻게 향상시키는가?
  • RQ3제안된 방법이 희박 보상 환경에서 국소 최적점에서 벗어나는 데 얼마나 기여하는가?
  • RQ4가이드 탐색 메커니즘이 Ant-v2와 같은 도전적인 환경에서 훈련 안정성을 향상시키는가?
  • RQ5최종 수익과 수렴 속도 측면에서 DRL-EG의 성능은 사전 훈련 및 시범 주입 기반 모델과 비교해 어떻게 되는가?

주요 결과

  • DRL-EG는 Ant-v2 및 MountainCarContinuous 환경에서 SAC, PPO, 사전 훈련이 적용된 PPO, DDPGfD를 모두 능가하여 더 높은 최종 수익을 달성한다.
  • Ant-v2 환경에서 DRL-EG는 전문가 시범 수준의 성능을 달성했으며, SAC와 DDPGfD는 불안정한 훈련과 낮은 수렴 성능를 보였다.
  • Ant-v2 환경에서 4개의 랜덤 시드 중 3개에서 DRL-EG는 국소 최적점에서 벗어나는 데 성공했으며, SAC는 그 자리에 갇혀 있었다.
  • Hopper와 HalfCheetah 환경에서는 DRL-EG가 SAC에 비해 약간의 성능 향상을 보였으며, 이는 가이드 메커니즘이 희박 보상 또는 고복잡도 환경에서 가장 유익하다는 것을 시사한다.
  • DRL-EG는 특히 Ant-v2와 같이 비정적 환경에서 훈련 안정성이 향상되었으며, 이전에는 정책의 작은 변화가 성능 붕괴를 유발했다.
  • 식별기-가이드 메커니즘은 희박 보상으로 인해 표준 DRL 방법이 효과를 발휘하지 못하는 상황에서도 효과적인 탐색을 가능하게 했으며, MountainCarContinuous 작업에서 SAC와 PPO가 0의 수익을 기록한 데 비해 이를 극복했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.