Skip to main content
QUICK REVIEW

[논문 리뷰] Stable Policy Optimization via Off-Policy Divergence Regularization

Abdelaziz Touati, Amy Zhang|arXiv (Cornell University)|2020. 03. 09.
Reinforcement Learning in Robotics참고 문헌 30인용 수 8
한 줄 요약

이 논문은 오프-폴리시, 적대적 훈련을 사용하여 연속된 정책 간의 상태-행동 방문 분포 간의 산란을 최소화함으로써 정책 갱신을 정규화하는 안정적인 정책 최적화 방법 PPO-DICE를 제안한다. 이 방법은 행동 확률 클리핑에 의존하는 것과는 달리 장기적인 분포 이탈을 직접 제약함으로써 아타리 및 머주코 벤치마크에서 PPO와 TRPO보다 샘플 효율성과 최종 성능을 향상시킨다.

ABSTRACT

Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO) are among the most successful policy gradient approaches in deep reinforcement learning (RL). While these methods achieve state-of-the-art performance across a wide range of challenging tasks, there is room for improvement in the stabilization of the policy learning and how the off-policy data are used. In this paper we revisit the theoretical foundations of these algorithms and propose a new algorithm which stabilizes the policy improvement through a proximity term that constrains the discounted state-action visitation distribution induced by consecutive policies to be close to one another. This proximity term, expressed in terms of the divergence between the visitation distributions, is learned in an off-policy and adversarial manner. We empirically show that our proposed method can have a beneficial effect on stability and improve final performance in benchmark high-dimensional control tasks.

연구 동기 및 목표

  • 정책 그래เดียน트 방법인 PPO와 TRPO에서의 불안정성과 오프-폴리시 데이터의 열악한 재사용 문제를 해결하기 위해.
  • 연속된 정책 간 장기적인 상태-행동 방문 분포 이탈을 직접 제약함으로써 정책 최적화의 안정성을 향상시키기 위해.
  • 오프-폴리시, 적대적 훈련을 사용하여 방문 분포 간의 산란을 추정하고 정규화하는 방법을 개발하기 위해.
  • 직접 방문 분포 정규화가 더 나은 최종 성능과 샘플 효율성으로 이어지는지 경험적으로 검증하기 위해.
  • 행동 확률 클리핑이 장기적인 분포 이탈을 제어하는 데 부족하며, 방문 분포 제어가 더 효과적임을 보여주기 위해.

제안 방법

  • 연속된 정책에 의해 유도되는 상태-행동 방문 분포 간의 산란을 기반으로 한 새로운 정규화 항을 제안한다.
  • 판별자 네트워크를 통해 오프-폴리시, 적대적 훈련을 사용하여 방문 분포 간의 산란을 추정한다.
  • 산란 정규화를 PPO의 서면 목적 함수에 통합하여, 큰 분포 이탈을 방지하는 새로운 목적 함수를 구성한다.
  • 이중 최적화 방식을 사용한다: 정책는 정규화된 목적 함수를 최대화하도록 갱신되고, 판별자는 방문 분포 산란을 정확히 추정하도록 훈련된다.
  • 정책 목적 함수와 산란 정규화를 균형 잡기 위해 하이퍼파rameter λ를 사용하며, 훈련 중에 적응적으로 조정된다.
  • PPO와 일관되게 행동 손실에 클리핑을 적용하여 추가로 훈련을 안정화시킨다.

실험 결과

연구 질문

  • RQ1직접적인 상태-행동 방문 분포 산란 정규화가 정책 최적화의 안정성과 최종 성능을 향상시킬 수 있는가?
  • RQ2딥 강화 학습에서 오프-폴리시, 적대적 추정 방식이 방문 분포 산란 정규화에 효과적이고 확장 가능한가?
  • RQ3방문 분포 산란을 통한 장기적 분포 이탈 제어가 행동 확률 클리핑보다 더 나은 샘플 효율성과 성능을 제공하는가?
  • RQ4다양한 고차원 제어 환경에서 제안된 방법이 PPO와 TRPO와 비교해 어떻게 성능을 내는가?
  • RQ5실제로 최적의 성능을 내기 위해 필요한 하이퍼파ram터 설정(예: 판별자 스텝 수, 학습률)은 무엇인가?

주요 결과

  • PPO-DICE는 17개의 아타리 환경 중 12개에서 PPO를 뛰어넘었으며, 평균 최종 보상에서 통계적으로 유의미한 향상을 보였다.
  • 머주코 벤치마크에서, PPO-DICE는 테스트한 6개의 가장 도전적인 환경 중 5개에서 PPO와 TRPO보다 더 높은 최종 성능를 달성했다.
  • 행동 손실 클리핑과 적응적 λ 스케줄링을 적용한 방법이 우수한 안정성을 보였으며, 클리핑이 없는 변형에서 관찰된 성능 붕괴를 방지했다.
  • 정책 갱신당 K=5개의 판별자 최적화 스텝과 정책 학습률의 10배인 판별자 학습률 조합이 환경 전반에서 최고의 성능을 냈다.
  • 경험 결과, 방문 분포 산란 정규화가 행동 확률 제약에만 의존하는 것보다 더 안정적인 훈련과 더 나은 일반화를 이끌어냈다.
  • 추이 분석 결과, 방문 분포 정규화를 사용하더라도 행동 손실 클리핑이 변동성에 의한 정책 열화를 방지하기 위해 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.