Skip to main content
QUICK REVIEW

[논문 리뷰] Proximal Policy Optimization with Relative Pearson Divergence

Taisuke Kobayashi|arXiv (Cornell University)|2020. 10. 07.
Reinforcement Learning in Robotics참고 문헌 30인용 수 4
한 줄 요약

이 논문은 PPO의 히우리스틱 클리핑을 상대 피어슨 발산(RPE) 기반 정규화로 대체하는 새로운 프록시 정책 최적화 변종인 PPO-RPE를 제안한다. 이는 이론적으로 타당한 최소화 목표와 균형 잡힌 정책 업데이트를 제공한다. PPO-RPE는 네 가지 벤치마크 작업에서 우수하거나 동등한 성능을 기록하며, 기준 정책으로의 정책 업데이트를 더 효과적으로 제약하여 학습 안정성과 수렴성을 향상시킨다.

ABSTRACT

The recent remarkable progress of deep reinforcement learning (DRL) stands on regularization of policy for stable and efficient learning. A popular method, named proximal policy optimization (PPO), has been introduced for this purpose. PPO clips density ratio of the latest and baseline policies with a threshold, while its minimization target is unclear. As another problem of PPO, the symmetric threshold is given numerically while the density ratio itself is in asymmetric domain, thereby causing unbalanced regularization of the policy. This paper therefore proposes a new variant of PPO by considering a regularization problem of relative Pearson (RPE) divergence, so-called PPO-RPE. This regularization yields the clear minimization target, which constrains the latest policy to the baseline one. Through its analysis, the intuitive threshold-based design consistent with the asymmetry of the threshold and the domain of density ratio can be derived. Through four benchmark tasks, PPO-RPE performed as well as or better than the conventional methods in terms of the task performance by the learned policy.

연구 동기 및 목표

  • 표준 PPO에서 명확하지 않은 최소화 목표로 인해 원칙적인 정규화 목적이 부족한 문제를 해결하기 위해.
  • 비대칭 밀도 비율에 대해 대칭적인 클리핑 임계값을 적용함으로써 발생하는 정책 정규화의 불균형 문제를 해결하기 위해.
  • 상대 피어슨 발산(RPE)에 기반한 임계값 기반 정규화 방법을 유도하여 직관적이면서도 이론적으로 엄밀한 정책 업데이트를 가능하게 하기 위해.
  • 정책 업데이트 간의 RPE 발산을 명시적으로 최소화하여 딥 강화 학습의 학습 안정성과 성능을 향상시키기 위해.

제안 방법

  • PPO의 밀도 비율 클리핑을 상대 피어슨 발산(RPE) 기반 정규화 항으로 대체하여 명확한 최소화 목표를 제공한다.
  • 대칭적인 임계값을 상대 밀도 비율 영역으로 매핑하여, 밀도 비율의 비대칭성과 일치하는 임계값 기반의 RPE 정규화 수익을 유도한다.
  • RPE 발산을 소프트 제약으로 사용하여 최신 정책와 기준 정책 간의 거리를 최소화함으로써 안정적이고 부드러운 정책 업데이트를 촉진한다.
  • 정규화 강도를 제어하기 위해 임계값 파rameter ε를 사용하며, 직관적인 설계를 유지하면서도 이론적 기반을 확보한다.
  • RPE 정규화를 정책 최적화 목표에 통합하여, 이점을 기반으로 한 학습과 추가 정규화(예: 엔트로피 및 TD 정규화)를 결합한다.
  • 강력한 최적화기(td-AmsProp)를 사용하여 구현하고, 메모리 비용을 줄이기 위해 경험 재생을 회피하며, 효율적 학습을 위한 적응형 유전성 추적을 중점으로 한다.

실험 결과

연구 질문

  • RQ1RPE 기반 정규화는 표준 PPO의 히우리스틱 클리핑보다 더 명확하고 원칙적인 최소화 목표를 제공할 수 있는가?
  • RQ2비대칭 밀도 비율에 대해 대칭 클리핑을 적용하는 것과 비교해, RPE 발산을 사용하면 더 균형 잡히고 효과적인 정책 정규화가 이루어지는가?
  • RQ3PPO-RPE는 다양한 강화 학습 벤치마크에서 PPO와 PPO-RB와 비교해 더 우수하거나 동등한 작업 성능을 달성할 수 있는가?
  • RQ4학습 중에 PPO-RPE의 정책 정규화 강도와 일관성은 전통적 방법과 비교해 어떻게 다른가?

주요 결과

  • PPO-RPE는 하프체타, 하프체타, 하프체타, 하프체타를 포함한 네 가지 벤치마크 작업 전부에서 PPO와 PPO-RB를 능가하거나 동등하게 성능을 기록했다.
  • 하프체타에서 PPO-RPE는 국소 최적점 회피에 도움이 되는 더 강력하고 일관성 있는 정규화 덕분에 열등한 성능을 보였다.
  • PPO-RPE의 정규화 항은 학습 전반에 걸쳐 활성화되어 있었으며, PPO와 PPO-RB는 임계값 내에 있을 경우 정규화가 비활성화되는 것과는 달리, 정책 업데이트에 대한 더 지속적인 제약이 있음을 시사했다.
  • 저차원 및 고차원 제어 작업 모두에서 PPO와 PPO-RB보다 PPO-RPE가 더 빠른 학습 수렴을 보였다.
  • 정규화의 정도(σ(ρ−ρ†))가 PPO-RPE에서 일관되게 더 높았으며, 이는 더 강력하고 균일한 정책 제약을 확인하는 데 기여했다.
  • 이론적 분석을 통해 RPE 기반 정규화가 명확한 최소화 목표를 제공함으로써 표준 PPO의 최적화 목표에 대한 모호성을 해결함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.