Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Robust Linear Quadratic Regulators with Gaussian Processes

Alexander von Rohr, Matthias Neumann-Brosig|arXiv (Cornell University)|2021. 05. 17.
Gaussian Processes and Bayesian Inference참고 문헌 27인용 수 10
한 줄 요약

이 논문은 가우시안 프로세스(GP)-기반 선형화된 동역학 모델의 전체 사후 분포를 활용하여 최악의 불확실성 범위가 아닌, 확률적 접근 방식의 강건한 선형 제곱조절기(LQR)를 제안한다. GP의 불확실성 분포 하에서 기대 성능을 최적화하면서도 사전에 지정된 확률로 안정성을 확보함으로써, 최악의 경우 기반 강건 제어 및 확실성 등가 설계에 비해 유의미하게 향상된 제어 성능을 달성하며, 신뢰도 구간을 통한 공식적인 확률적 강건성 보장을 제공한다.

ABSTRACT

Probabilistic models such as Gaussian processes (GPs) are powerful tools to learn unknown dynamical systems from data for subsequent use in control design. While learning-based control has the potential to yield superior performance in demanding applications, robustness to uncertainty remains an important challenge. Since Bayesian methods quantify uncertainty of the learning results, it is natural to incorporate these uncertainties into a robust design. In contrast to most state-of-the-art approaches that consider worst-case estimates, we leverage the learning method's posterior distribution in the controller synthesis. The result is a more informed and, thus, more efficient trade-off between performance and robustness. We present a novel controller synthesis for linearized GP dynamics that yields robust controllers with respect to a probabilistic stability margin. The formulation is based on a recently proposed algorithm for linear quadratic control synthesis, which we extend by giving probabilistic robustness guarantees in the form of credibility bounds for the system's stability.Comparisons to existing methods based on worst-case and certainty-equivalence designs reveal superior performance and robustness properties of the proposed method.

연구 동기 및 목표

  • 가우시안 프로세스에서 유래한 확률적 불확실성을 통합하여 학습 기반 제어에서 성능-강건성 트레이드오프를 해결하고자 한다.
  • GP 기반 동역학 모델에서 최악의 경우 기반 강건 제어 방법의 과도한 보수성 문제를 해결하고자 한다.
  • 기대 성능을 최적화하면서도 확률적 안정성 보장을 보장하는 제어기 설계 방법을 개발하고자 한다.
  • 사용자가 사전에 지정할 수 있는 신뢰도 기반으로 닫힌 루프 안정성에 대한 공식적인 신뢰도 구간을 제공하고자 한다.
  • 전체 사후 분포를 활용할 경우 최악의 경우나 확실성 등가 접근 방식보다 더 뛰어난 실증적 성능을 달성할 수 있음을 입증하고자 한다.

제안 방법

  • 시스템 동역학의 가우시안 프로세스 모델을 선형화하여, GP의 사후 분포에 따라 매개변수화된 선형 시간 불변(LTI) 시스템의 가족을 도출한다.
  • GP의 사후 분포에 따른 시스템 매개변수에 대한 기대 비용을 최적화하는 강건 LQR 설계 문제를 수립한다.
  • 기존의 결정론적 최악의 경우 경계를 확률적 신뢰도 간격으로 대체함으로써, 성능와 강건성 사이의 체계적인 트레이드오프를 가능하게 한다.
  • 최근에 제안된 LQR 설계 알고리즘을 확률적 강건성 제약 조건을 통합하도록 확장하여, 닫힌 루프 시스템이 사용자가 정의한 신뢰 수준으로 안정성을 유지하도록 보장한다.
  • 사후 분포의 샘플링 기반 근사화를 통해 기대 성능 및 안정성 한계를 효율적으로 계산할 수 있도록 한다.
  • 닫힌 루프 시스템 행렬의 고유값 반경에 대한 신뢰도 구간을 통해 공식적인 확률적 강건성 보장을 제공한다.

실험 결과

연구 질문

  • RQ1최악의 경우 경계가 아닌 GP 모델의 전체 사후 분포를 활용함으로써 학습 기반 제어에서 성능을 향상시킬 수 있는가?
  • RQ2GP 기반 동역학 모델을 사용할 경우, 사전에 지정된 확률로 닫힌 루프 안정성을 공식적으로 보장할 수 있는가?
  • RQ3GP 사후 분포 하에서 기대 성능을 최적화하는 것이 최악의 경우나 확실성 등가 설계에 비해 더 뛰어난 실증적 성능을 낳는가?
  • RQ4실제 시스템에서 데이터 양과 모델 정확도가 증가함에 따라 이 방법의 성능는 어떻게 변화하는가?
  • RQ5기존의 강건 제어 방법에 비해 GP 기반 환경에서 더 낮은 보수성을 달성할 수 있는가?

주요 결과

  • 합성 시스템에서 제안된 확률적 강건(PR) 제어기는 최악의 경우 강건(R) 및 확실성 등가(CE) 제어기보다 기대 제곱비용 측면에서 뛰어난 성능를 보였으며, 특히 3 및 5개의 롤아웃에서 두드러진 성능 향상을 보였다.
  • 로터리 펜듈럼 시뮬레이션에서 PR 제어기는 평균 성능 측면에서 CE 및 R 제어기 모두를 능가했으며, 100%의 실행 가능성과 보장된 안정성을 확보했다.
  • PR 설계의 모든 실행 가능한 사례에서 안정적인 제어기가 도출되었으며, 이는 확률적 강건성 보장의 타당성을 확인한다.
  • 합성 시스템에서 8개의 롤아웃을 수행했을 때, PR 제어기는 진짜 비선형 시스템을 대상으로 설계된 제어기의 성능을 재현했으며, 이는 높은 정확도와 효율성을 시사한다.
  • 최악의 경우 기반 강건 제어에 비해 상당히 낮은 보수성을 달성하여, 사전에 지정된 신뢰 수준을 유지하면서도 더 높은 기대 성능를 확보했다.
  • 성능 향상의 대가로는 사용자가 사전에 지정한 작은 확률 범위 내에서의 불안정성 가능성이 존재하지만, 이는 공식적으로 경계되고 사용자에 의해 제어된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.