[논문 리뷰] Sample Complexity of Linear Quadratic Gaussian (LQG) Control for Output Feedback Systems
이 논문은 동적 시스템의 동역학이 알려져 있지 않고 상태가 부분적으로 관측되는 시스템에서 강건한 선형 정규분포 제어기(LQG)를 학습하기 위한 종단 간 샘플 복잡도 경계를 수립한다. 비점근적 시스템 식별과 H-무한대 경계가 있는 추정 오차, 그리고 입력-출력 매개변수화(IOP)를 통한 강건 제어기 설계를 조합함으로써, 모델 오차에 따라 LQG 성능이 선형적으로 악화되는 것을 달성하였으며, 이는 개방 루프 안정 시스템에서 전 상태 LQR 학습의 최적 스케일링과 일치한다.
This paper studies a class of partially observed Linear Quadratic Gaussian (LQG) problems with unknown dynamics. We establish an end-to-end sample complexity bound on learning a robust LQG controller for open-loop stable plants. This is achieved using a robust synthesis procedure, where we first estimate a model from a single input-output trajectory of finite length, identify an H-infinity bound on the estimation error, and then design a robust controller using the estimated model and its quantified uncertainty. Our synthesis procedure leverages a recent control tool called Input-Output Parameterization (IOP) that enables robust controller design using convex optimization. For open-loop stable systems, we prove that the LQG performance degrades linearly with respect to the model estimation error using the proposed synthesis procedure. Despite the hidden states in the LQG problem, the achieved scaling matches previous results on learning Linear Quadratic Regulator (LQR) controllers with full state observations.
연구 동기 및 목표
- 시스템 동역학이 알려져 있지 않고 상태가 부분적으로 관측될 때 LQG 제어기 학습을 위한 이론적 샘플 복잡도 보장 간극을 메우기 위해.
- 전체 상태 재구성 없이도 모델 불확실성 하에서 안정성과 성능을 보장하는 강건 제어 설계 절차를 개발하기 위해.
- 숨겨진 상태와 출력 피드백의 과제에도 불구하고, 전체 상태 LQR 학습과 유사한 샘플 복잡도 스케일링을 달성하기 위해.
- 정량화된 모델 불확실성을 사용하여 볼록적이고 해석 가능한 강건 제어기 설계를 위한 입력-출력 매개변수화(IOP)를 활용하기 위해.
제안 방법
- 유한 길이의 단일 입력-출력 궤적을 사용하여 비점근적 시스템 식별 기법으로 시스템 모델을 추정한다.
- 시스템 불일치에 대한 비점근적 H-무한대 노름 경계를 사용하여 추정 오차를 정량화한다.
- 모든 안정화 제어기를 볼록 집합으로 표현할 수 있도록 입력-출력 매개변수화(IOP)를 적용하여, 강건 제어 설계를 위한 볼록 최적화를 가능하게 한다.
- 추정된 모델과 그 H-무한대 불확실성 경계를 사용하여 강건 LQG 제어기를 설계함으로써, 닫힌 루프 안정성을 보장한다.
- 유도된 제어기의 부분 최적화 갭이 모델 추정 오차에 따라 선형적으로 스케일링됨을 증명한다.
- 시스템 식별 오차 경계와 강건 제어 성능 보장 조건을 조합하여 종단 간 샘플 복잡도 경계를 수립한다.
실험 결과
연구 질문
- RQ1시스템 동역학이 알려져 있지 않고 출력 피드백이 적용되는 조건에서, 전체 상태 LQR 학습 성능을 따라잡는 LQG 제어에 대한 샘플 복잡도 경계를 달성할 수 있는가?
- RQ2진짜 시스템 모델이 알려져 있지 않고 오직 출력 궤적만 관측되는 조건에서, 강건한 안정성과 성능을 어떻게 확보할 수 있는가?
- RQ3부분 관측 LQG 문제에서 모델 추정 오차와 제어기 부분 최적화 갭 사이의 최적 트레이드오프는 무엇인가?
- RQ4비점근적 시스템 식별과 효과적으로 조합될 수 있는 IOP를 통한 볼록 강건 제어 설계는 엄밀한 성능 경계를 도출하는 데에 효과적인가?
주요 결과
- 제안된 강건 제어기 설계 절차는 LQG 성능이 모델 추정 오차에 따라 선형적으로 악화되며, 부분 최적화 갭이 ε의 O(ε)로 나타나며, 여기서 ε는 추정 오차의 H-무한대 노름임을 보장한다.
- 개방 루프 안정 시스템의 경우, 이 방법은 전체 상태 LQR 학습과 동일한 샘플 복잡도 스케일링, 즉 O(N⁻¹)을 달성하여 문헌에서 알려진 최상의 결과와 일치한다.
- 입력-출력 매개변수화(IOP)의 사용은 볼록 최적화를 가능하게 하여 강건 제어기 설계의 해석 가능성과 확장 가능성을 보장한다.
- 시스템 추정 오차에 대한 비점근적 H-무한대 경계는 시스템 식별 오차와 제어기 성능 악화 사이의 연결 고리로서 핵심적이다.
- 이 방법은 내부 상태공간 표현을 재구성할 필요가 없어, 직접적으로 입력-출력 데이터를 사용한 제어기 학습이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.