[논문 리뷰] Distributionally Robust Linear Quadratic Control
이 논문은 노이즈 분포가 알려져 있지 않고 노미널 가우시안 분포를 중심으로 한 워샤프스키 애매함 집합 내에 존재하는 분포적으로 강건한 선형-정현가우시안(LQG) 제어 프레임워크를 제안한다. 이러한 강건화에도 불구하고, 저자들은 선형 출력 피드백 제어기가 여전히 최적임을 증명하며, 칼만 필터링과 동적 프로그래밍을 활용하여 최적 정책을 효율적으로 계산하는 프랭크-울프 기반 알고리즘을 개발한다. 최악의 경우 분포는 가우시안임을 규명하여 표준 LQG 솔버를 활용한 효율적 계산이 가능하다.
Linear-Quadratic-Gaussian (LQG) control is a fundamental control paradigm that is studied in various fields such as engineering, computer science, economics, and neuroscience. It involves controlling a system with linear dynamics and imperfect observations, subject to additive noise, with the goal of minimizing a quadratic cost function for the state and control variables. In this work, we consider a generalization of the discrete-time, finite-horizon LQG problem, where the noise distributions are unknown and belong to Wasserstein ambiguity sets centered at nominal (Gaussian) distributions. The objective is to minimize a worst-case cost across all distributions in the ambiguity set, including non-Gaussian distributions. Despite the added complexity, we prove that a control policy that is linear in the observations is optimal for this problem, as in the classic LQG problem. We propose a numerical solution method that efficiently characterizes this optimal control policy. Our method uses the Frank-Wolfe algorithm to identify the least-favorable distributions within the Wasserstein ambiguity sets and computes the controller's optimal policy using Kalman filter estimation under these distributions.
연구 동기 및 목표
- 노이즈 분포가 알려져 있지 않고 워샤프스키 애매함 집합 내에 존재하는 비가우시안 분포를 다룰 수 있도록 고전적 LQG 제어 문제를 일반화한다.
- 분포적 강건성 하에서 선형 출력 피드백 제어기가 최적임을 입증한다.
- 대규모 준선형계획법을 사용하지 않고도 강건 제어 문제를 효율적으로 해결할 수 있는 알고리즘을 개발한다.
- 애매함 집합 내에서 최악의 경우 분포가 가우시안임을 입증하여 표준 LQG 솔버를 알고리즘에 활용할 수 있음을 보여준다.
- 실행 시간과 수렴 속도 측면에서 제안된 프랭크-울프 방법과 직접적인 준선형계획법 접근법을 비교한다.
제안 방법
- 분포적으로 강건한 LQG 문제를 워샤프스키 볼 내에서 제어 정책과 최악의 노이즈 분포에 대한 최소화-최대화 최적화 문제로 재구성한다.
- 볼록 쌍대성과 이완 기법을 사용하여(특히 워샤프스키 볼을 젤브리히 볼로 대체함) 최악의 비용에 대한 상한을 유도한다.
- 관측값에 대한 선형 정책으로 제어기를 제한하고, 상한이 하한과 일치함을 증명함으로써 선형 제어기가 최적임을 입증한다.
- 각 반복에서 칼만 필터링과 동적 프로그래밍을 사용하여 표준 LQG 문제를 해결하는 프랭크-울프 알고리즘을 구현한다.
- 프랭크-울프 업데이트 단계에서 목적 함수의 기울기를 파이토치의 자동 미분 기능을 활용해 계산한다.
- 충분한 감소를 보장하기 위해 백트래킹 전략을 적용하고, δ = 0.95를 사용한다.
실험 결과
연구 질문
- RQ1워샤프스키 애매함 집합을 갖는 분포적으로 강건한 LQG 환경에서 선형 출력 피드백 정책이 여전히 최적일까?
- RQ2이 강건한 설정에서 최악의 노이즈 분포의 구조는 어떠한가?
- RQ3대규모 준선형계획법을 풀지 않고도 최적 제어기를 효율적으로 계산할 수 있을까?
- RQ4이 문제에 적용된 프랭크-울프 방법은 하위선형 수렴 속도를 달성하고 병렬 처리가 가능한가?
- RQ5애매함 집합에 비가우시안 분포가 포함되어 있더라도 최악의 경우 분포가 가우시안일까?
주요 결과
- 분포적 애매함이 존재하는 상황에서도 관측값에 대한 최적 제어 정책은 여전히 선형이며, 고전적 LQG 결과를 일반화한다.
- 워샤프스키 애매함 집합 내에서 최악의 경우 분포는 가우시안이며, 이는 강건 제어 문제를 크게 단순화시킨다.
- 프랭크-울프 알고리즘은 최적성 갭 ε에 대해 O(1/ε)의 하위선형 수렴 속도를 달성한다.
- 모든 문제 시간 길이에서 직접 준선형계획법(MOSEK) 대비 프랭크-울프 방법이 일관되게 더 낮은 실행 시간을 기록한다.
- T = 10일 때, 프랭크-울프 방법은 50회 이내의 반복으로 높은 정확도(최적성 갭 10⁻³ 이하)에 도달한다.
- 알고리즘은 병렬 처리에 적합하며, 각 프랭크-울프 반복에서 효율적인 LQG 솔버를 활용함으로써 확장 가능한 계산이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.