[논문 리뷰] Maximum Entropy-Regularized Multi-Goal Reinforcement Learning
다중 목표 강화학습에서 보상 가중 엔트로피 목표를 도입하고 다양하게 달성된 목표에서 학습하기 위한 최대 엔트로피 기반 우선순위화(MEP)를 제시하여 다중 목표 로봇 작업의 성능과 샘플 효율성을 향상시킵니다.
In Multi-Goal Reinforcement Learning, an agent learns to achieve multiple goals with a goal-conditioned policy. During learning, the agent first collects the trajectories into a replay buffer, and later these trajectories are selected randomly for replay. However, the achieved goals in the replay buffer are often biased towards the behavior policies. From a Bayesian perspective, when there is no prior knowledge about the target goal distribution, the agent should learn uniformly from diverse achieved goals. Therefore, we first propose a novel multi-goal RL objective based on weighted entropy. This objective encourages the agent to maximize the expected return, as well as to achieve more diverse goals. Secondly, we developed a maximum entropy-based prioritization framework to optimize the proposed objective. For evaluation of this framework, we combine it with Deep Deterministic Policy Gradient, both with or without Hindsight Experience Replay. On a set of multi-goal robotic tasks of OpenAI Gym, we compare our method with other baselines and show promising improvements in both performance and sample-efficiency.
연구 동기 및 목표
- 타깃 목표 분포가 알려지지 않은 경우 다양한 달성 목표로부터 학습을 유도한다.
- 최대 엔트로피와 다중 목표 RL을 결합하여 행동 정책에 대한 재생 편향을 줄인다.
- 원래의 엔트로피 규제 목표를 하한하는 안전한 대리 목표를 도출한다.
- 목표 다양성을 높이면서 정책 수익을 최대화하는 실용적 최적화 프레임워크(MEP)를 제공한다.
제안 방법
- 누적 보상으로 궤적을 가중하는 다중 목표 RL용 가중 엔트로피 목표를 정의한다.
- 최적화를 안정화하기 위한 하한으로 안전한 대리 목표를 도출한다.
- 목표 궤적의 밀도 모델을 이용한 최대 엔트로피 기반의 우선순위화(MEP) 프레임워크를 도입한다.
- 잠재 변수 모델(가우시안 혼합)로 p(tau^g)를 모델링하고 보충 밀도를 사용하여 제안 분포 q(tau^g)를 구성한다.
- 다양한 목표를 재생하기 위해 MEP 우선순위화를 더한 오프폴리시 방법(HER 여부와 무관한 DDPG)으로 최적화한다.
- 알고리즘(MEP)을 제공하고 OpenAI Gym 다중 목표 로봇 작업에서 개선을 입증한다.
실험 결과
연구 질문
- RQ1MEP를 통한 목표 엔트로피 항의 도입이 오프폴리시 다중 목표 RL 방법(DDPG, DDPG+HER)을 향상시키는가?
- RQ2MEP가 로봇 조작 작업에서 샘플 효율성과 성능을 향상시키는가?
- RQ3훈련 중 달성된 목표 분포의 엔트로피에 MEP가 어떤 영향을 미치는가?
주요 결과
- MEP는 수렴을 가속하고 여섯 가지 로봇 작업에서 기본값 대비 최종 성능을 향상시킨다.
- 일부 작업에서 더 빠른 학습과 최대 39.34% 포인트의 성능 향상을 달성한다.
- 이전 PER에 비해 학습 시간을 줄이면서 더 강한 성능을 달성한다.
- 환경 전반에서 평균적으로 샘플 효율성을 약 두 배 향상시킨다.
- MEP 학습 중 달성된 목표 분포의 엔트로피가 증가하는 것이 확인되어 의도한 효과를 확인한다.
- 팔 로봇 작업에서 DDPG+MEP의 학습 시간은 Baseline의 약 1.2배이고, DDPG+PER은 약 5배로, MEP의 계산 효율성을 부각시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.