[논문 리뷰] Deep Reinforcement Learning with Relative Entropy Stochastic Search
이 논문은 상대 엔트로피와 엔트로피 정규화를 사용하여 정책 업데이트를 제약함으로써 정책 학습을 안정화하는 딥 강화학습 방법을 제안한다. 이는 가우시안 정책과 이차 Q함수를 사용할 때 해석적 최적화를 가능하게 하며, 연속 제어 과제에서 DDPG 및 연속 Q학습보다 더 안정적인 학습을 달성한다.
Many reinforcement learning methods for continuous control tasks are based on updating a policy function by maximizing an approximated action-value function or Q-function. However, the Q-function also depends on the policy and this dependency often leads to unstable policy learning. To overcome this issue, we propose a method that does not greedily exploit the Q-function. To do so, we upper-bound the Kullback-Leibler divergence of the new policy while maximizing the Q-function. Furthermore, we also lower-bound the entropy of the new policy to maintain its exploratory behavior. We show that by using a Gaussian policy and a Q-function that is quadratic in actions, we can solve the corresponding constrained optimization problem in a closed form. In addition, we show that our method can be regarded as a variant of the well-known deterministic policy gradient method. Through experiments, we evaluate the proposed method using a neural network as a function approximator and show that it gives more stable learning performance than the deep deterministic policy gradient method and the continuous Q-learning method.
연구 동기 및 목표
- 딥 강화학습에서 Q함수와 정책 간의 상호의존성으로 인한 정책 학습의 불안정성 문제를 해결한다.
- 엔트로피 정규화를 통해 탐색 행동을 유지함으로써 샘플 효율성과 수렴성을 향상시킨다.
- 엔트로피 및 상대 엔트로피 제약 조건 하에서 정책 업데이트의 해석적 해를 도출한다.
- DDPG 및 연속 Q학습과 같은 결정론적 정책 그래디언트 방법의 안정적인 대안을 제공한다.
제안 방법
- 정책 개선 과정에서의 안정성을 확보하기 위해 정책 업데이트 단계를 제한하기 위해 상대 엔트로피 상한을 사용한다.
- 정책 엔트로피에 하한을 적용하여 탐색 행동을 유지하고 조기 수렴을 방지한다.
- 해석적 최적화 문제를 해결하기 위해 가우시안 정책과 행동에 대해 이차적인 Q함수를 가정한다.
- Q함수 최대화와 엔트로피 및 상대 엔트로피 제약 조건을 균형 잡는 해석적 정책 업데이트 규칙을 유도한다.
- 정책 그래디언트의 변종으로서 방법을 재구성하며, 정규화를 정책 업데이트 과정에 통합한다.
- Q함수 및 정책 네트워크 모두에 신경망 함수 근사기를 사용하여 방법을 구현한다.
실험 결과
연구 질문
- RQ1상대 엔트로피 제약 조건이 연속 제어를 위한 딥 강화학습에서 정책 학습을 안정화할 수 있는가?
- RQ2엔트로피 정규화는 정책 최적화의 탐색 행동과 수렴성에 어떤 영향을 미치는가?
- RQ3가우시안 정책과 이차 Q함수 조건 하에서 제약 최적화 문제를 해석적으로 해결할 수 있는가?
- RQ4제안된 방법은 DDPG 및 연속 Q학습과 비교해 안정성과 성능 면에서 어떻게 다른가?
주요 결과
- 제안된 방법은 딥 결정론적 정책 그래디언트(DDPG) 방법보다 더 안정적인 학습 성능을 달성한다.
- 연속 제어 벤치마크에서 학습 안정성과 최종 성능 면에서 연속 Q학습을 능가한다.
- 해석적 해는 가우시안 정책과 이차 Q함수 조건 하에서 도출된다.
- 상대 엔트로피 및 엔트로피 제약 조건의 통합은 더 부드러운 정책 업데이트와 학습 중 분산 감소를 이끈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.