Skip to main content
QUICK REVIEW

[논문 리뷰] Entropy Regularization with Discounted Future State Distribution in Policy Gradient Methods

Riashat Islam, Raihan Seraj|arXiv (Cornell University)|2019. 12. 11.
Reinforcement Learning in Robotics참고 문헌 28인용 수 7
한 줄 요약

이 논문은 신경 밀도 추정기와 세 가지 시간 척도 프레임워크를 사용하여 할인된 미래 상태 분포의 엔트로피를 정규화함으로써 탐색을 향상시키는 새로운 정책 그래디언트 방법을 제안한다. 이 방법은 상태 공간의 커버리지와 샘플 효율성을 향상시키며, HalfCheetah 및 Hopper와 같은 연속 제어 벤치마크에서 더 빠른 학습과 뛰어난 성능을 보여준다.

ABSTRACT

The policy gradient theorem is defined based on an objective with respect to the initial distribution over states. In the discounted case, this results in policies that are optimal for one distribution over initial states, but may not be uniformly optimal for others, no matter where the agent starts from. Furthermore, to obtain unbiased gradient estimates, the starting point of the policy gradient estimator requires sampling states from a normalized discounted weighting of states. However, the difficulty of estimating the normalized discounted weighting of states, or the stationary state distribution, is quite well-known. Additionally, the large sample complexity of policy gradient methods is often attributed to insufficient exploration, and to remedy this, it is often assumed that the restart distribution provides sufficient exploration in these algorithms. In this work, we propose exploration in policy gradient methods based on maximizing entropy of the discounted future state distribution. The key contribution of our work includes providing a practically feasible algorithm to estimate the normalized discounted weighting of states, i.e, the extit{discounted future state distribution}. We propose that exploration can be achieved by entropy regularization with the discounted state distribution in policy gradients, where a metric for maximal coverage of the state space can be based on the entropy of the induced state distribution. The proposed approach can be considered as a three time-scale algorithm and under some mild technical conditions, we prove its convergence to a locally optimal policy. Experimentally, we demonstrate usefulness of regularization with the discounted future state distribution in terms of increased state space coverage and faster learning on a range of complex tasks.

연구 동기 및 목표

  • 희소 보상 또는 고차원 환경에서 기존 정책 그래디언트 방법이 균일한 상태 공간 커버리지 달성을 어려워하는 한계를 해결한다.
  • 정책 최적화에서 할인된 또는 정적 상태 분포를 추정하는 데 실용적으로 비현실적인 문제를 해결한다.
  • 할인된 미래 상태 분포의 엔트로피를 최대화하도록 정책을 명시적으로 정규화하는 방법을 개발한다. 이는 더 넓은 탐색을 촉진한다.
  • 정책 학습, 가치 함수 추정, 상태 분포 밀도 추정을 통합한 세 가지 시간 척도 알고리즘의 수렴 증명을 제공한다.
  • 표준 연속 제어 벤치마크에서 제안된 방법의 유효성을 입증한다. 특히 상태 공간 탐색이 핵심적인 환경에서 성능을 강조한다.

제안 방법

  • 정책 파라미터 θ에서 할인된 미래 상태 분포 dπθ(s)의 추정치를 제공하는 신경 밀도 추정기를 도입하여 상태 점유의 미분 가능 추정을 가능하게 한다.
  • 관측된 상태의 정책 유도 분포 하에서 로그우도의 하한을 최대화함으로써 변분 추론을 사용해 밀도 추정기를 훈련시킨다.
  • 정책, 가치 함수, 밀도 추정기가 서로 다른 속도로 업데이트되는 세 가지 시간 척도 알고리즘을 제안하여 안정적인 학습을 보장한다.
  • 추정된 할인된 상태 분포의 엔트로피를 정책 그래디언트 목표 함수에 정규화 항으로 통합하여 탐색을 장려한다.
  • 밀도 추정기가 정책 파라미터 θ에 명시적으로 의존하도록 보장하여 정규화가 미분 가능하고 종단 간 훈련이 가능하도록 한다.
  • 추정된 상태 분포 엔트로피를 상태 공간 커버리지의 대체 지표로 활용하여 극대화를 직접 최적화한다.

실험 결과

연구 질문

  • RQ1할인된 미래 상태 분포 기반 엔트로피 정규화가 정책 그래디언트 방법에서 탐색을 향상시킬 수 있는가?
  • RQ2학습 가능한 밀도 모델을 사용해 실용적으로 할인된 미래 상태 분포를 추정하는 것이 가능한가?
  • RQ3할인된 상태 분포의 엔트로피로 정책 최적화를 정규화하면 수렴 속도 향상과 더 나은 샘플 효율성이 달성되는가?
  • RQ4행동 공간 기반 표준 엔트로피 정규화(예: SAC)와 비교할 때, 제안된 방법은 상태 공간 커버리지 및 성능 측면에서 어떻게 다른가?
  • RQ5제안된 세 가지 시간 척도 알고리즘이 온건한 기술적 조건 하에서 국소 최적 정책으로 수렴할 수 있는가?

주요 결과

  • 제안된 방법은 HalfCheetah-v1 및 Hopper-v1과 같은 연속 제어 작업에서 학습 속도와 최종 성능을 크게 향상시키며, 특히 상태 공간 탐색이 핵심적인 환경에서 뚜렷한 성과를 보인다.
  • 정규화 계수 λ = 0.1일 때, 10개의 랜덤 시드에서 기준 DDPG 및 SAC에 비해 일관된 성능 향상을 달성하여 강건성과 재현 가능성을 입증한다.
  • 할인된 미래 상태 분포의 엔트로피는 상태 공간 커버리지에 강력한 대체 지표이며, 이를 극대화하면 더 균일하고 광범위한 상태 방문이 이뤄진다.
  • 온건한 기술적 조건 하에서 국소 최적 정책으로 수렴하며, 세 가지 시간 척도 알고리즘으로 이론적 근거를 제공한다.
  • 실험 결과 밀도 추정기가 할인된 상태 분포의 구조를 효과적으로 포착하여 이론적으로 유혹적인 정규화를 실용적으로 활용할 수 있음을 보여준다.
  • 제거 실험 결과, 정규화 항이 λ를 적절히 튜닝했을 때 가장 효과적이며, 극단적인 값에서는 수익 감소가 발생함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.