Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Optimization for Continuous Reinforcement Learning

Hanyang Zhao, Wenpin Tang|arXiv (Cornell University)|2023. 05. 30.
Advanced Multi-Objective Optimization Algorithms인용 수 6
한 줄 요약

이 논문은 확률적 미분 방정식을 사용하여 강화학습을 위한 연속시간 정책 최적화 프레임워크를 개발하며, 할인 목표를 위한 새로운 직업 시간 측정법을 도입한다. 성능 차이 및 국소 근사 공식을 유도하여 시간/공간 이산화 없이 정책 기울기 및 TRPO/PPO 방법의 연속적 대체 방법을 가능하게 하며, 실험을 통해 수렴성과 이산 기반 방법 대비 우수성을 입증한다.

ABSTRACT

We study reinforcement learning (RL) in the setting of continuous time and space, for an infinite horizon with a discounted objective and the underlying dynamics driven by a stochastic differential equation. Built upon recent advances in the continuous approach to RL, we develop a notion of occupation time (specifically for a discounted objective), and show how it can be effectively used to derive performance-difference and local-approximation formulas. We further extend these results to illustrate their applications in the PG (policy gradient) and TRPO/PPO (trust region policy optimization/ proximal policy optimization) methods, which have been familiar and powerful tools in the discrete RL setting but under-developed in continuous RL. Through numerical experiments, we demonstrate the effectiveness and advantages of our approach.

연구 동기 및 목표

  • 할인 목표를 위한 이산 MDP에서의 방문 빈도(직업 시간)에 대응하는 연속시간 대체법을 수립하기 위해.
  • 퍼티urbation 분석를 사용하여 연속시간 강화학습에서 성능 차이 및 국소 근사 공식을 유도하기 위해.
  • 사전 시간 또는 공간 이산화 없이 정책 기울기(PG), TRPO, PPO 방법의 연속시간 형태를 개발하기 위해.
  • 제안된 방법의 수렴성과 성능 향상을 연속 확률 제어 과제에서 입증하기 위해.

제안 방법

  • 연속시간 확률 제어에서 할인 목표를 위한 특별히 설계된 새로운 직업 시간 개념을 도입한다.
  • 퍼티urbation 분석를 사용하여 정책 변화와 성능 변화 간의 관계를 연결하는 성능 차이 공식을 유도한다.
  • 성능 지표의 국소 근사를 개발하고 증명 가능한 경계를 제공하여, 미니마이제이션-마이너제이션(MM) 알고리즘 설계를 가능하게 한다.
  • 유도된 공식을 통해 이산 방법을 연속 동역학에 적응시켜 연속시간 PG, TRPO, PPO 변형을 제안한다.
  • 신경망 파rameterization을 정책 및 가치 함수에 사용하며, 샘플된 궤적 기반 기울기 갱신을 수행한다.
  • CPPO에서 제곱근 및 선형 KL-발산을 사용하여 정책 갱신을 제어하며, 제거 실험을 통해 제곱근 변형이 더 뛰어난 수렴성을 보임을 확인한다.
Figure 1: Convergence of $\theta$ in $l_{2}$ distance
Figure 1: Convergence of $\theta$ in $l_{2}$ distance

실험 결과

연구 질문

  • RQ1할인 목표를 가진 이산 MDP에서의 방문 빈도(직업 시간)에 대응하는 연속시간 해석은 무엇인가?
  • RQ2이산 MDP에서와 유사한 성능 차이 공식을 연속시간 강화학습에서 유도할 수 있는가?
  • RQ3신뢰 영역 및 프록시멀 정책 최적화 방법은 연속시간, 연속 공간 강화학습에 어떻게 적응시킬 수 있는가?
  • RQ4제안된 연속시간 정책 최적화 방법은 수렴성 및 안정성 측면에서 이산 시간 대비 우수한 성능을 보일 수 있는가?

주요 결과

  • 제안된 연속시간 정책 기울기(CPG) 및 CPPO 방법은 확률적 제어 과제에 대한 수치 실험에서 최적 정책으로 수렴한다.
  • 제곱근 KL-발산을 사용하는 CPPO는 선형 KL 버전보다 우수하며 국소 최적점 회피와 더 안정적인 수렴을 보인다.
  • CPG 및 CPPO는 조잡한 시간 이산화(δt = 0.1) 조건에서도 이산 시간 PG 및 PPO와 비교해 유사하거나 우수한 성능을 달성하여 연속 공식의 잠재적 이점이 있음을 시사한다.
  • 연속 프레임워크는 기저의 SDE 동역학의 연속성을 유지하면서 명시적 시간 또는 공간 이산화 없이 정책 최적화를 가능하게 한다.
  • 성능 차이 공식은 정책 향상의 정확한 추정을 가능하게 하여 이론적 기반의 타당성을 검증한다.
  • 방법은 시간 이산화에 대해 강건하며, 다양한 δt 값에서 일관된 성능을 보임을 실험으로 입증한다.
Figure 2: Convergence of $\pi_{\theta}$ in KL-divegence
Figure 2: Convergence of $\pi_{\theta}$ in KL-divegence

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.