[논문 리뷰] Robust Policy Iteration for Continuous-time Linear Quadratic Regulation
이 논문은 소규모이고 유계인 외란이 존재하는 상황에서 연속시간 선형 제곱형규칙(LQR)에 대한 Kleinman의 정책 반복의 안정성을 확립한다. 정책 반복을 이산시간 비선형 시스템으로 모델링함으로써, 외란이 소규모일 경우 국소적 입력-상태 안정성(local input-to-state stability)을 증명하여, 해가 외란이 존재할 때도 최적 해의 작은 이웃 영역 내에 유지되고 수렴함을 보장한다. 이 결과는 모델 불확실성 하에서 오프-정책 데이터 기반 LQR 알고리즘에 대한 안정성 보장을 가능하게 한다.
This paper studies the robustness of policy iteration in the context of continuous-time infinite-horizon linear quadratic regulation (LQR) problem. It is shown that Kleinman's policy iteration algorithm is inherently robust to small disturbances and enjoys local input-to-state stability in the sense of Sontag. More precisely, whenever the disturbance-induced input term in each iteration is bounded and small, the solutions of the policy iteration algorithm are also bounded and enter a small neighborhood of the optimal solution of the LQR problem. Based on this result, an off-policy data-driven policy iteration algorithm for the LQR problem is shown to be robust when the system dynamics are subjected to small additive unknown bounded disturbances. The theoretical results are validated by a numerical example.
연구 동기 및 목표
- 소규모 외란이 존재하는 연속시간 LQR에 대한 Kleinman의 정책 반복 알고리즘의 안정성 분석.
- 외란이 유계이고 소규모일 경우 정책 반복 과정의 국소적 입력-상태 안정성(local input-to-state stability, ISS) 확립.
- 초기 안정화 제어 이득과 소규모 오차가 존재하더라도 알고리즘이 최적 해의 작은 이웃 영역으로 수렴함을 보여줌.
- 유도된 안정성 결과를 적용하여 오프-정책 데이터 기반 정책 반복의 안정성 검증.
제안 방법
- 외란을 입력으로 하는 이산시간 비선형 시스템으로 정책 반복 과정을 모델링.
- 리아푸노프 분석을 사용하여 오차 없음 경우 최적 해의 국소적 지수 안정성 증명.
- 입력-상태 안정성(ISS) 이론을 적용하여, 유계이고 소규모 외란이 최적 해로부터의 유계이고 소규모의 이탈을 초래함을 보임.
- 그로워랄의 부등식과 행렬 노름 분석을 사용하여 정확한 반복과 왜곡된 반복 간의 차이를 한정.
- 정책 업데이트 단계에서 리카티 연산자의 수축 성질과 선형 연산자의 가역성을 활용.
- 유계 외란 하에서 수렴을 보여주는 수치 예제를 통해 이론적 결과의 검증.
실험 결과
연구 질문
- RQ1연속시간 LQR에 대한 Kleinman의 정책 반복 알고리즘이 시스템 동역학 또는 정책 평가에서 소규모이고 유계인 외란에 대해 안정적인가?
- RQ2외란이 존재할 경우 정책 반복 과정은 유계이면서 최적 해의 작은 이웃 영역으로 수렴하는가?
- RQ3모델 기반 정책 반복의 이론적 안정성은 오프-정책 데이터 기반 정책 반복 알고리즘으로 확장 가능한가?
- RQ4외란 존재 시 정책 반복 알고리즘이 국소적 입력-상태 안정성을 유지하는 조건은 무엇인가?
- RQ5시스템 동역학 또는 함수 근사 오차는 연속시간 LQR에서 정책 반복의 수렴 행동에 어떤 영향을 미치는가?
주요 결과
- 연속시간 LQR 문제의 최적 해는 오차 없음 정책 반복 과정의 국소적 지수 안정 평형점이다.
- 외란이 소규모이고 유계일 경우 정책 반복 알고리즘은 국소적 입력-상태 안정성을 확보하여 최적 해로부터의 유계이고 소규모의 이탈을 보장한다.
- 임의의 초기 안정화 제어 이득이 존재할 때, 외란이 충분히 작다면 알고리즘은 최적 해의 작은 이웃 영역으로 수렴한다.
- 참고 문헌 [11]의 오프-정책 데이터 기반 정책 반복 알고리즘은 시스템 동역학에 소규모의 덧셈형 유계 외란이 존재할 경우 안정함을 입증하였다.
- 그로워랄의 부등식과 행렬 노름 분석을 통해 정확한 반복과 왜곡된 반복 간 오차에 대한 이론적 한계를 도출하였다.
- 수치적 검증을 통해 외란이 유계일 경우에도 알고리즘이 안정적임과 동시에 최적 해의 작은 이웃 영역으로 수렴함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.