Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Gradient-based Algorithms for Continuous-time Linear Quadratic Control

Jingjing Bu, Afshin Mesbahi|arXiv (Cornell University)|2020. 06. 12.
Adaptive Dynamic Programming Control참고 문헌 29인용 수 11
한 줄 요약

이 논문은 연속시간 선형 제곱조절기(LQR) 문제를 위한 정책 기울기 기반 알고리즘을 제안하며, 안정화 피드백 이득에 대한 최적의 제어 이득을 행렬 함수로 공식화한다. 이는 연속시간의 경량 유도, 자연 기울기 유도, 준뉴턴 유도에 대한 수렴 보장을 가능하게 하는 부드러움, 강력성, 기울기 지배성 성질을 확립한다. 적절한 스텝 사이즈 규칙 하에 선형 및 Q-제곱수렴 속도를 보이며, 사영 기울기 하강법을 통한 희소 제어 합성으로 확장된다.

ABSTRACT

We consider the continuous-time Linear-Quadratic-Regulator (LQR) problem in terms of optimizing a real-valued matrix function over the set of feedback gains. The results developed are in parallel to those in Bu et al. [1] for discrete-time LTI systems. In this direction, we characterize several analytical properties (smoothness, coerciveness, quadratic growth) that are crucial in the analysis of gradient-based algorithms. We also point out similarities and distinctive features of the continuous time setup in comparison with its discrete time analogue. First, we examine three types of well-posed flows direct policy update for LQR: gradient flow, natural gradient flow and the quasi-Newton flow. The coercive property of the corresponding cost function suggests that these flows admit unique solutions while the gradient dominated property indicates that the underling Lyapunov functionals decay at an exponential rate; quadratic growth on the other hand guarantees that the trajectories of these flows are exponentially stable in the sense of Lyapunov. We then discuss the forward Euler discretization of these flows, realized as gradient descent, natural gradient descent and quasi-Newton iteration. We present stepsize criteria for gradient descent and natural gradient descent, guaranteeing that both algorithms converge linearly to the global optima. An optimal stepsize for the quasi-Newton iteration is also proposed, guaranteeing a $Q$-quadratic convergence rate--and in the meantime--recovering the Kleinman-Newton iteration. Lastly, we examine LQR state feedback synthesis with a sparsity pattern. In this case, we develop the necessary formalism and insights for projected gradient descent, allowing us to guarantee a sublinear rate of convergence to a first-order stationary point.

연구 동기 및 목표

  • 해당 Riccati 방정식을 풀지 않고 피드백 이득을 직접 갱신하는 연속시간 LQR를 위한 기울기 기반 최적화 방법을 개발한다.
  • 안정화 피드백 이득에 대한 LQR 비용 함수의 분석적 성질—부드러움, 강력성, 기울기 지배성, 제곱 성장—을 확립한다.
  • 연속시간 유도(기울기, 자연 기울기, 준뉴턴)의 분석 및 리아푸노프 안정성과 리아푸노프 함수의 지수 감쇠를 통한 수렴 분석.
  • 이산시간 대응체(기울기 하강법, 자연 기울기 하강법, 준뉴턴)의 스텝 사이즈 기준을 유도하여 선형 및 Q-제곱수렴을 보장한다.
  • 희소성 패턴을 가진 구조적 LQR에 대해 사영 기울기 하강법을 적용하여, 일阶 정류점으로의 하향 수렴 보장

제안 방법

  • 초기 상태에 대한 의존성을 제거하기 위해 선형 독립적인 초기 조건에 대해 평균을 취함으로써, 무한 시간 LQR 비용을 안정화 피드백 이득에 대한 행렬 함수로 재구성한다.
  • 유도된 비용 함수가 부드럽고, 강력하며, 기울기 지배적임을 증명하여 컴act한 하위레벨 집합과 전역 최소값의 존재를 보장한다.
  • 세 가지 연속시간 유도—기울기 유도, 자연 기울기 유도, 준뉴턴 유도—를 분석하여 리아푸노프 함수의 지수 감쇠와 궤적의 지수 안정성을 보여준다.
  • 유도의 프로이드 오일러 이산화를 기울기 하강법, 자연 기울기 하강법, 준뉴턴 반복으로 유도하며, 선형 수렴을 보장하는 명시적 스텝 사이즈 조건을 도출한다.
  • 최적의 스텝 사이즈를 제안하여 준뉴턴 반복의 Q-제곱수렴을 확보하고, 클라인만-뉴턴 방법을 복원한다.
  • 희소성 제약 조건을 가진 구조적 LQR에 대해 사영 기울기 하강법 프레임워크를 개발하여, 업데이트를 희소성 패턴에 투영함으로써 구조적 충실도를 유지한다.

실험 결과

연구 질문

  • RQ1해당 대칭 Riccati 방정식을 풀지 않고도 정책 기울기 방법을 연속시간 LQR 문제에 엄밀하게 적용할 수 있는가?
  • RQ2연속시간에서 피드백 이득에 대한 LQR 비용 함수는 부드러움, 강력성, 기울기 지배성 등의 분석적 성질을 어떻게 갖는가?
  • RQ3연속시간 정책 갱신 유도(기울기, 자연 기울기, 준뉴턴)는 유일한 해를 가지며, 리아푸노프 함수의 감쇠와 리아푸노프 의미에서의 지수 안정성을 보이는가?
  • RQ4연속시간 LQR에서 이산시간 기울기 하강법 및 자연 기울기 하강법의 선형 수렴을 보장하는 스텝 사이즈 조건은 무엇인가?
  • RQ5사영 기울기 하강법을 사용하여 희소성 제약 조건이 있는 구조적 LQR 문제를 해결할 수 있으며, 어떤 수렴 속도를 보장할 수 있는가?

주요 결과

  • 안정화 피드백 이득에 대한 LQR 비용 함수는 부드럽고, 강력하며, 기울기 지배적이며, 컴act한 하위레벨 집합과 전역 최소값의 존재를 보장한다.
  • 기울기 유도, 자연 기울기 유도, 준뉴턴 유도 모두 유일한 해를 가지며, 리아푸노프 함수의 지수 감쇠를 보이며, 궤적은 리아푸노프 의미에서 지수 안정성을 갖는다.
  • 유도된 스텝 사이즈 조건 하에 기울기 하강법 및 자연 기울기 하강법은 전역 최적점으로 선형 수렴하며, 하위레벨 집합에서 스텝 사이즈가 0에서 멀리 떨어져 있음을 보장한다.
  • 준뉴턴 반복의 최적 스텝 사이즈는 Q-제곱수렴을 보장하며, 고전적인 클라인만-뉴턴 반복 방법을 복원한다.
  • 희소성 패턴을 가진 구조적 LQR에 대한 사영 기울기 하강법은 일阶 정류점으로 하향 수렴 속도가 하향 수렴한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.