Skip to main content
QUICK REVIEW

[논문 리뷰] Global Convergence of Policy Gradient Primal-dual Methods for Risk-constrained LQRs

Feiran Zhao, Keyou You|arXiv (Cornell University)|2021. 04. 11.
Reinforcement Learning in Robotics참고 문헌 46인용 수 8
한 줄 요약

이 논문은 위험 제약이 있는 선형 제곱 조절기(RC-LQR)에 대한 정책 그래เดียน트 원자-이중 방법을 제안하며, 모델 기반 및 샘플 기반 설정 모두에서 전역 수렴을 확립한다. 라그랑주 함수의 강한 이중성, 강력한 강제성, 국소 그래디언트 지배성 및 리프시츠 연속 그래디언트를 증명함으로써, RC-LQR에 내재된 비볼록, 제약이 있는 최적화 구조에도 불구하고 전역 수렴을 달성한다.

ABSTRACT

While the techniques in optimal control theory are often model-based, the policy optimization (PO) approach directly optimizes the performance metric of interest. Even though it has been an essential approach for reinforcement learning problems, there is little theoretical understanding on its performance. In this paper, we focus on the risk-constrained linear quadratic regulator (RC-LQR) problem via the PO approach, which requires addressing a challenging non-convex constrained optimization problem. To solve it, we first build on our earlier result that an optimal policy has a time-invariant affine structure to show that the associated Lagrangian function is coercive, locally gradient dominated and has local Lipschitz continuous gradient, based on which we establish strong duality. Then, we design policy gradient primal-dual methods with global convergence guarantees in both model-based and sample-based settings. Finally, we use samples of system trajectories in simulations to validate our methods.

연구 동기 및 목표

  • 위험 제약이 있는 LQR에 대한 정책 최적화에서 이론적 수렴 보장을 제공하지 못하는 문제를 해결하기 위해.
  • 이차 비용을 가진 비볼록 제약이 있는 연속적인 비볼록 제약 마르코프 결정 과정(CMDP)에서 강한 이중성을 확립하기 위해.
  • 무한 수평선 RC-LQR 문제에 대해 전역 수렴을 보장하는 원자-이중 방법을 설계하기 위해.
  • 시뮬레이션을 통해 샘플링된 시스템 궤적을 사용하여 방법을 검증하기 위해.
  • 비볼록 분산 유사 제약으로 인해 전역 그래디언트 지배성이 부재하는 문제를 극복하기 위해.

제안 방법

  • RC-LQR에서 최적 정책의 아핀 구조를 활용하여 이득 행렬과 바이어스 벡터 매개변수에 기반해 문제를 재구성하기 위해.
  • 라그랑주 함수가 강력한 강제성, 국소 그래디언트 지배성, 국소 리프시츠 연속 그래디언트를 가짐을 증명하기 위해.
  • 이차 비용을 가진 연속 CMDP 클래스에 대해 강한 이중성을 확립하며, 이는 비볼록 설정에서의 새로운 결과이다.
  • 원자 및 이중 변수(정책 및 승수)를 번갈아 가며 정책 그래디언트와 이중 상승을 사용해 갱신하는 원자-이중 알고리즘을 설계하기 위해.
  • 모델 기반 설정에서는 정확한 그래디언트를 사용하고, 샘플 기반 설정에서는 샘플 기반 그래디언트 추정기를 사용하기 위해.
  • 제논의 부등식과 합계 추론을 적용하여 샘플 기반 설정에서 이중 함수의 수렴 속도를 유도하기 위해.

실험 결과

연구 질문

  • RQ1비볼록성과 제약 최적화의 존재에도 불구하고, 정책 그래디언트 원자-이중 방법이 위험 제약이 있는 LQR에 대해 전역 수렴을 달성할 수 있는가?
  • RQ2무한 수평선, 연속 CMDP에 대해 이차 비용과 분산 유사 제약이 존재할 경우 강한 이중성이 성립하는가?
  • RQ3아핀 정책 매개변수화 하에 RC-LQR 문제의 라그랑주 함수가 전역 그래디언트 지배성 또는 강력한 강제성을 가지는가?
  • RQ4이러한 조건 하에서 모델 기반 및 샘플 기반 설정 모두에서 전역 수렴을 보장할 수 있는가?
  • RQ5샘플 기반 설정에서 이중 함수에 대해 유도할 수 있는 수렴 속도는 무엇인가?

주요 결과

  • RC-LQR의 라그랑주 함수는 강력한 강제성과 국소 리프시츠 연속 그래디언트를 가지며, 이는 전역 수렴 보장을 가능하게 한다.
  • 이차 비용을 가진 연속 CMDP 클래스에 대해 강한 이중성이 공식적으로 증명되었으며, 이는 비볼록 설정에서 이전에 확립되지 않은 새로운 결과이다.
  • 정책 그래디언트 원자-이중 방법은 모델 기반 및 샘플 기반 설정 모두에서 전역 수렴을 달성한다.
  • 샘플 기반 설정에서는 이중 함수가 O(1/√k) 속도로 수렴하며, 이중 갭은 O(1/√k) + O(1/k) 항으로 유계이다.
  • 샘플링된 시스템 궤적을 사용한 시뮬레이션을 통해 제안된 방법의 효과성과 수렴성을 검증하였다.
  • 라그랑주 함수의 강력한 강제성과 국소 그래디언트 지배성을 활용하여, 비볼록 분산 유사 제약으로 인한 전역 그래디언트 지배성 부재 문제를 극복하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.