Skip to main content
QUICK REVIEW

[논문 리뷰] Maximum Entropy-Regularized Multi-Goal Reinforcement Learning

Rui Zhao, Xudong Sun|arXiv (Cornell University)|2019. 05. 21.
Reinforcement Learning in Robotics인용 수 47
한 줄 요약

다중 목표 강화학습에서 보상 가중 엔트로피 목표를 도입하고 다양하게 달성된 목표에서 학습하기 위한 최대 엔트로피 기반 우선순위화(MEP)를 제시하여 다중 목표 로봇 작업의 성능과 샘플 효율성을 향상시킵니다.

ABSTRACT

In Multi-Goal Reinforcement Learning, an agent learns to achieve multiple goals with a goal-conditioned policy. During learning, the agent first collects the trajectories into a replay buffer, and later these trajectories are selected randomly for replay. However, the achieved goals in the replay buffer are often biased towards the behavior policies. From a Bayesian perspective, when there is no prior knowledge about the target goal distribution, the agent should learn uniformly from diverse achieved goals. Therefore, we first propose a novel multi-goal RL objective based on weighted entropy. This objective encourages the agent to maximize the expected return, as well as to achieve more diverse goals. Secondly, we developed a maximum entropy-based prioritization framework to optimize the proposed objective. For evaluation of this framework, we combine it with Deep Deterministic Policy Gradient, both with or without Hindsight Experience Replay. On a set of multi-goal robotic tasks of OpenAI Gym, we compare our method with other baselines and show promising improvements in both performance and sample-efficiency.

연구 동기 및 목표

  • 타깃 목표 분포가 알려지지 않은 경우 다양한 달성 목표로부터 학습을 유도한다.
  • 최대 엔트로피와 다중 목표 RL을 결합하여 행동 정책에 대한 재생 편향을 줄인다.
  • 원래의 엔트로피 규제 목표를 하한하는 안전한 대리 목표를 도출한다.
  • 목표 다양성을 높이면서 정책 수익을 최대화하는 실용적 최적화 프레임워크(MEP)를 제공한다.

제안 방법

  • 누적 보상으로 궤적을 가중하는 다중 목표 RL용 가중 엔트로피 목표를 정의한다.
  • 최적화를 안정화하기 위한 하한으로 안전한 대리 목표를 도출한다.
  • 목표 궤적의 밀도 모델을 이용한 최대 엔트로피 기반의 우선순위화(MEP) 프레임워크를 도입한다.
  • 잠재 변수 모델(가우시안 혼합)로 p(tau^g)를 모델링하고 보충 밀도를 사용하여 제안 분포 q(tau^g)를 구성한다.
  • 다양한 목표를 재생하기 위해 MEP 우선순위화를 더한 오프폴리시 방법(HER 여부와 무관한 DDPG)으로 최적화한다.
  • 알고리즘(MEP)을 제공하고 OpenAI Gym 다중 목표 로봇 작업에서 개선을 입증한다.

실험 결과

연구 질문

  • RQ1MEP를 통한 목표 엔트로피 항의 도입이 오프폴리시 다중 목표 RL 방법(DDPG, DDPG+HER)을 향상시키는가?
  • RQ2MEP가 로봇 조작 작업에서 샘플 효율성과 성능을 향상시키는가?
  • RQ3훈련 중 달성된 목표 분포의 엔트로피에 MEP가 어떤 영향을 미치는가?

주요 결과

  • MEP는 수렴을 가속하고 여섯 가지 로봇 작업에서 기본값 대비 최종 성능을 향상시킨다.
  • 일부 작업에서 더 빠른 학습과 최대 39.34% 포인트의 성능 향상을 달성한다.
  • 이전 PER에 비해 학습 시간을 줄이면서 더 강한 성능을 달성한다.
  • 환경 전반에서 평균적으로 샘플 효율성을 약 두 배 향상시킨다.
  • MEP 학습 중 달성된 목표 분포의 엔트로피가 증가하는 것이 확인되어 의도한 효과를 확인한다.
  • 팔 로봇 작업에서 DDPG+MEP의 학습 시간은 Baseline의 약 1.2배이고, DDPG+PER은 약 5배로, MEP의 계산 효율성을 부각시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.