Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning with Relative Entropy Stochastic Search

Voot Tangkaratt, Abbas Abdolmaleki|arXiv (Cornell University)|2017. 05. 22.
Reinforcement Learning in Robotics인용 수 3
한 줄 요약

이 논문은 상대 엔트로피와 엔트로피 정규화를 사용하여 정책 업데이트를 제약함으로써 정책 학습을 안정화하는 딥 강화학습 방법을 제안한다. 이는 가우시안 정책과 이차 Q함수를 사용할 때 해석적 최적화를 가능하게 하며, 연속 제어 과제에서 DDPG 및 연속 Q학습보다 더 안정적인 학습을 달성한다.

ABSTRACT

Many reinforcement learning methods for continuous control tasks are based on updating a policy function by maximizing an approximated action-value function or Q-function. However, the Q-function also depends on the policy and this dependency often leads to unstable policy learning. To overcome this issue, we propose a method that does not greedily exploit the Q-function. To do so, we upper-bound the Kullback-Leibler divergence of the new policy while maximizing the Q-function. Furthermore, we also lower-bound the entropy of the new policy to maintain its exploratory behavior. We show that by using a Gaussian policy and a Q-function that is quadratic in actions, we can solve the corresponding constrained optimization problem in a closed form. In addition, we show that our method can be regarded as a variant of the well-known deterministic policy gradient method. Through experiments, we evaluate the proposed method using a neural network as a function approximator and show that it gives more stable learning performance than the deep deterministic policy gradient method and the continuous Q-learning method.

연구 동기 및 목표

  • 딥 강화학습에서 Q함수와 정책 간의 상호의존성으로 인한 정책 학습의 불안정성 문제를 해결한다.
  • 엔트로피 정규화를 통해 탐색 행동을 유지함으로써 샘플 효율성과 수렴성을 향상시킨다.
  • 엔트로피 및 상대 엔트로피 제약 조건 하에서 정책 업데이트의 해석적 해를 도출한다.
  • DDPG 및 연속 Q학습과 같은 결정론적 정책 그래디언트 방법의 안정적인 대안을 제공한다.

제안 방법

  • 정책 개선 과정에서의 안정성을 확보하기 위해 정책 업데이트 단계를 제한하기 위해 상대 엔트로피 상한을 사용한다.
  • 정책 엔트로피에 하한을 적용하여 탐색 행동을 유지하고 조기 수렴을 방지한다.
  • 해석적 최적화 문제를 해결하기 위해 가우시안 정책과 행동에 대해 이차적인 Q함수를 가정한다.
  • Q함수 최대화와 엔트로피 및 상대 엔트로피 제약 조건을 균형 잡는 해석적 정책 업데이트 규칙을 유도한다.
  • 정책 그래디언트의 변종으로서 방법을 재구성하며, 정규화를 정책 업데이트 과정에 통합한다.
  • Q함수 및 정책 네트워크 모두에 신경망 함수 근사기를 사용하여 방법을 구현한다.

실험 결과

연구 질문

  • RQ1상대 엔트로피 제약 조건이 연속 제어를 위한 딥 강화학습에서 정책 학습을 안정화할 수 있는가?
  • RQ2엔트로피 정규화는 정책 최적화의 탐색 행동과 수렴성에 어떤 영향을 미치는가?
  • RQ3가우시안 정책과 이차 Q함수 조건 하에서 제약 최적화 문제를 해석적으로 해결할 수 있는가?
  • RQ4제안된 방법은 DDPG 및 연속 Q학습과 비교해 안정성과 성능 면에서 어떻게 다른가?

주요 결과

  • 제안된 방법은 딥 결정론적 정책 그래디언트(DDPG) 방법보다 더 안정적인 학습 성능을 달성한다.
  • 연속 제어 벤치마크에서 학습 안정성과 최종 성능 면에서 연속 Q학습을 능가한다.
  • 해석적 해는 가우시안 정책과 이차 Q함수 조건 하에서 도출된다.
  • 상대 엔트로피 및 엔트로피 제약 조건의 통합은 더 부드러운 정책 업데이트와 학습 중 분산 감소를 이끈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.