Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Gradient Method For Robust Reinforcement Learning

Yue Wang, Shaofeng Zou|arXiv (Cornell University)|2022. 05. 15.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 모델 불일치 하에서 강화학습의 강건성에 대해 전역 최적성과 복잡도 보장을 갖는 최초의 정책 그래디언트 방법을 제안한다. 프레셰 하위도수를 기반으로 한 강건 정책 그래디언트와 이를 개선한 스무딩 버전을 제안하며, $Ø(\epsilon^{-3})$ 복잡도로 $\epsilon$-전역 최적해에 도달한다. 액터-크리틱 프레임워크로의 확장과 표본 설정 및 모델-프리 설정 하에서의 이론적 수렴 보장을 포함한다.

ABSTRACT

This paper develops the first policy gradient method with global optimality guarantee and complexity analysis for robust reinforcement learning under model mismatch. Robust reinforcement learning is to learn a policy robust to model mismatch between simulator and real environment. We first develop the robust policy (sub-)gradient, which is applicable for any differentiable parametric policy class. We show that the proposed robust policy gradient method converges to the global optimum asymptotically under direct policy parameterization. We further develop a smoothed robust policy gradient method and show that to achieve an $ε$-global optimum, the complexity is $\mathcal O(ε^{-3})$. We then extend our methodology to the general model-free setting and design the robust actor-critic method with differentiable parametric policy class and value function. We further characterize its asymptotic convergence and sample complexity under the tabular setting. Finally, we provide simulation results to demonstrate the robustness of our methods.

연구 동기 및 목표

  • 모델 불일치 하에서 강건 강화학습에 대해 증명 가능한 전역 최적성과 강건성 보장을 갖는 정책 그래디언트 방법의 부족을 해결한다.
  • 모든 미분 가능하고 리프시츠 조건을 만족하는 파rametric 정책 클래스에 적용 가능한 강건 정책 그래디언트를 개발한다.
  • 직접 정책 매개변수화 하에서 폴랴크-로자예프스키 조건(PL 조건)을 만족함으로써 전역 최적해로의 점근적 수렴을 확보한다.
  • 비차별성 문제 해결을 위해 강건 값 함수의 스무딩 근사 기반으로 스무딩 강건 정책 그래디언트 방법을 설계하여 $\epsilon$-전역 최적해를 달성하기 위한 샘플 복잡도 $\mathcal{O}(\epsilon^{-3})$ 를 정량화한다.
  • 직접 정책 매개변수화 하에서 표본 설정 및 모델-프리 설정으로의 확장을 위해 강건 액터-크리틱 알고리즘을 제안하며, 표본 설정 하에서 이론적 수렴 보장을 확보한다.

제안 방법

  • 강건 값 함수의 프레셰 하위도수를 유도하여, 이는 모든 미분 가능하고 리프시츠 조건을 만족하는 정책 클래스에 적용 가능한 강건 정책 그래디언트가 된다.
  • 직접 매개변수화된 정책 하에서 강건 값 함수가 폴랴크-로자예프스키(PL) 조건을 만족함을 증명함으로써 정책 그래디언트 방법의 전역 수렴을 보장한다.
  • 비차별성 문제 해결을 위해 강건 값 함수의 스무딩 근사를 통해 스무딩 강건 정책 그래디언트 방법을 도입하여 수렴 속도 분석을 가능하게 한다.
  • 다양한 정책과 가치 함수 근사를 사용한 모델-프리 강건 액터-크리틱 알고리즘을 설계하며, 불확실성 집합의 중심에서 샘플을 기반으로 학습한다.
  • 가장 악성인 전이 커널에 대비하여 정책을 최적화하기 위해 $R$-오염 불확실성 집합 모델을 활용하여 최악의 MDP를 정의한다.
  • 하위도수 분석, PL 조건, 농도 불등식 등의 이론적 도구를 활용하여 수렴성 및 복잡도 한계를 확립한다.

실험 결과

연구 질문

  • RQ1모델 불일치 하에서 강건 강화학습에 대해 전역 최적성을 보장하는 정책 그래디언트 방법을 개발할 수 있는가?
  • RQ2비차별성 강건 값 함수는 어떻게 효과적으로 최적화할 수 있으며, 어떤 수렴 속도를 달성할 수 있는가?
  • RQ3강건 정책 그래디언트 방법의 스무딩 버전이 $\epsilon$-전역 최적해를 달성하기 위해 필요한 샘플 복잡도는 얼마인가?
  • RQ4강건 정책 그래디언트 프레임워크는 함수 근사를 포함한 모델-프리 설정으로 확장될 수 있는가?
  • RQ5제안된 강건 액터-크리틱 방법은 직접 정책 매개변수화 하에서 표본 설정에서 전역 최적성을 달성하는가?

주요 결과

  • 직접 정책 매개변수화 하에서 강건 값 함수가 폴랴크-로자예프스키(PL) 조건을 만족함에 따라 강건 정책 그래디언트 방법은 거의 확실하게 전역 최적해로 수렴한다.
  • 스무딩 강건 정책 그래디언트 방법은 샘플 복잡도 $\mathcal{O}(\epsilon^{-3})$ 를 통해 $\epsilon$-전역 최적해에 도달한다.
  • 직접 정책 매개변수화 하에서 표본 설정 하에서 강건 액터-크리틱 알고리즘이 전역으로 수렴하며, 완벽한 기울기 정보를 가정한다.
  • Garnet 문제에 대한 실험 결과는 강건 정책 그래디언트 및 액터-크리틱 방법이 모델 불일치 하에서 비강건 대비 worst-case 성능에서 뛰어난 성능을 보임을 보여준다.
  • 여러 환경와 불확실성 수준에서 강건 액터-크리틱 방법은 바닐라 액터-크리틱보다 더 높은 worst-case 할중 누적 보상치를 달성한다.
  • 이론적 분석은 $R$-오염 불확실성 하에서 강건 값 함수의 구조가 기울기 기반 방법을 통한 안정적이고 최적의 정책 학습을 지원함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.