[논문 리뷰] Primal-dual Learning for the Model-free Risk-constrained Linear Quadratic Regulator
이 논문은 상태 예측 분산 제약 조건 하에 안정화 가능한 애핀 피드백 정책(u = -Kx + l)을 통해 제어기가 학습되는 위험 제약이 있는 선형 제곱조절기(LQR) 제어를 위한 모델 프리 원-듀얼 학습 프레임워크를 제안한다. 비볼록성에도 불구하고 국소적 경사기여도와 강력한 이중성의 특성을 활용하여 전역 수렴을 달성하며, 이중성 갭이 0임을 증명하고 알려진 시스템 모델이 없어도 효율적인 정책 최적화를 가능하게 한다.
Risk-aware control, though with promise to tackle unexpected events, requires a known exact dynamical model. In this work, we propose a model-free framework to learn a risk-aware controller with a focus on the linear system. We formulate it as a discrete-time infinite-horizon LQR problem with a state predictive variance constraint. To solve it, we parameterize the policy with a feedback gain pair and leverage primal-dual methods to optimize it by solely using data. We first study the optimization landscape of the Lagrangian function and establish the strong duality in spite of its non-convex nature. Alongside, we find that the Lagrangian function enjoys an important local gradient dominance property, which is then exploited to develop a convergent random search algorithm to learn the dual function. Furthermore, we propose a primal-dual algorithm with global convergence to learn the optimal policy-multiplier pair. Finally, we validate our results via simulations.
연구 동기 및 목표
- 알 수 없는 동역학을 가진 선형 시스템에서 위험 인식 제어를 위한 모델 프리 강화학습 프레임워크를 개발하는 것.
- 알려진 시스템 모델이 없이 상태 분산 위험 제약 조건 하에서 제약 조건이 있는 최적 제어 문제를 해결하는 것.
- 비볼록이고 위험 제약이 있는 LQR 환경에서 정책 최적화에 대한 이론적 보장을 수립하는 것.
- 애핀 피드백 정책에 대해 비볼록이고 제약 조건이 있는 최적화 환경에서 강력한 이중성과 이중성 갭 0을 증명하는 것.
- 최적의 정책-승수 쌍을 학습하기 위한 전역 수렴을 보장하는 원-듀얼 알고리즘을 설계하는 것.
제안 방법
- 1단계 상태 예측 분산 제약 조건을 가진 무한 시간 영역 최적화 문제로 위험 제약이 있는 LQR를 수식화한다.
- 최적의 정책을 애핀 피드백 형태로 표현한다: u∗(x) = −Kx + l이며, 이는 이득 쌍 (K, l)을 동시에 최적화한다.
- 위험 제약 조건을 위한 승수를 포함한 라그랑주 함수를 도입하고, 안정화 가능한 정책 집합 위에서 라그랑주 함수의 국소적 경사기여도와 리프시츠 연속성을 증명한다.
- 슬레이터 조건 하에서 비볼록성에도 불구하고 강력한 이중성과 이중성 갭 0을 확립한다. 이는 목적 함수, 제약 조건, 정책 집합이 모두 비볼록임에도 불구하고 성립한다.
- 정책 학습을 위한 0차 최적화와 승수 갱신을 위한 투영 기반 하향 기울기 하강법을 조합한 원-듀얼 알고리즘을 제안한다.
- 유한한 노이즈 조건 하에서 경사 기울기 추정치가 유계임을 보장하는 랜덤 서치를 활용하고, 투영 기반 갱신을 통해 전역 수렴을 보장한다.
실험 결과
연구 질문
- RQ1애핀 피드백 정책을 사용하는 비볼록이고 위험 제약이 있는 LQR 문제에서 강력한 이중성이 성립할 수 있는가?
- RQ2안정화 가능한 애핀 정책 집합 위에서 라그랑주 함수가 경사기여도와 리프시츠 성질을 갖는가?
- RQ3모델 프리이고 위험 제약이 있는 LQR 환경에서 원-듀얼 알고리즘이 전역 수렴을 달성할 수 있는가?
- RQ4시스템 모델이 알려져 있지 않고 최적화가 비볼록한 상황에서 이중성 갭 0을 달성할 수 있는가?
- RQ5시스템 모델 지식이 없을 때 정책과 승수를 함께 최적화하면서 이론적 수렴 보장을 확보할 수 있는가?
주요 결과
- 안정화 가능한 애핀 정책 집합 위에서 라그랑주 함수는 국소적 경사기여도와 리프시츠 연속성을 보이며, 수렴 보장을 가능하게 한다.
- 슬레이터 조건 하에서 비볼록성에도 불구하고 강력한 이중성과 이중성 갭 0이 성립한다.
- 제안된 원-듀얼 알고리즘은 시스템 궤적 데이터만을 사용하여 최적의 정책-승수 쌍으로 전역 수렴한다.
- 유한한 노이즈 조건 하에서 랜덤 서치 방법의 경사 기울기 추정치는 유계이며, 이는 수렴 안정성을 보장한다.
- 투영 기반 하향 기울기 하강법을 통한 승수 갱신은 감소하는 스텝 사이즈를 사용하여 하향 수렴 속도를 달성한다.
- 이 방법은 시스템 동역학 A와 B에 대한 사전 지식 없이도 위험 인식 제어기를 성공적으로 학습한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.