Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian model predictive control: Efficient model exploration and regret bounds using posterior sampling

Kim P. Wabersich, Melanie N. Zeilinger|arXiv (Cornell University)|2020. 05. 24.
Advanced Control Systems Optimization참고 문헌 24인용 수 9
한 줄 요약

이 논문은 알려지지 않은 시스템 동역학과 목표를 학습할 때 탐색과 이용을 균형 잡는 데 사용하는 베이지안 모델 예측 제어(MPC) 프레임워크를 제안한다. 사전 분포에서의 후행 표본 추출을 통해 MPC 제어기를 샘플링함으로써, 표준 MPC 솔버를 사용하여 계산 효율성을 유지하면서도 유한 시간 내의 최소 손실 보장을 달성한다. 이는 노이즈가 있는 피드백을 갖는 비선형 자동차 트레일러 시스템에서 검증되었다.

ABSTRACT

Tight performance specifications in combination with operational constraints make model predictive control (MPC) the method of choice in various industries. As the performance of an MPC controller depends on a sufficiently accurate objective and prediction model of the process, a significant effort in the MPC design procedure is dedicated to modeling and identification. Driven by the increasing amount of available system data and advances in the field of machine learning, data-driven MPC techniques have been developed to facilitate the MPC controller design. While these methods are able to leverage available data, they typically do not provide principled mechanisms to automatically trade off exploitation of available data and exploration to improve and update the objective and prediction model. To this end, we present a learning-based MPC formulation using posterior sampling techniques, which provides finite-time regret bounds on the learning performance while being simple to implement using off-the-shelf MPC software and algorithms. The performance analysis of the method is based on posterior sampling theory and its practical efficiency is illustrated using a numerical example of a highly nonlinear dynamical car-trailer system.

연구 동기 및 목표

  • 시스템 동역학과 목적이 불확실할 때 데이터 기반 MPC에서 탐색과 이용을 균형 잡는 데 도전 과제를 해결하기 위해.
  • 복잡한 확률적 동적 프로그래밍이 필요 없이 데이터 이용과 정보성 데이터 수집 간의 자동 균형 조정이 가능한 기반 학습 MPC 제어기를 개발하기 위해.
  • 불확실성 하에서 기반 학습 MPC의 이론적 성능 보장을 유한 시간 손실 한계의 형태로 제공하기 위해.
  • 후행 표본 추출 기법을 활용하여 표준 MPC 소프트웨어를 직접 사용할 수 있도록 실용적인 구현을 가능하게 하기 위해.

제안 방법

  • 각 에피소드의 시작 시, 현재 시스템 동역학과 목표에 대한 믿음에 기반해 최적 제어기의 후행 분포에서 MPC 제어기를 샘플링한다.
  • 불확실한 시스템 파라미터를 모델링하기 위해 베이지안 선형 회귀를 사용하고, 환경의 노이즈가 있는 측정치를 이용해 믿음을 업데이트한다.
  • 제약 조건 위반에 대비해 연장 변수를 포함한 비용 함수와 부드러운 제약 조건을 포함한 제어기 설계를 통해 학습 중 안정성을 확보한다.
  • 손실은 각 에피소드 동안 최적 제어기의 성능와 샘플링된 제어기의 성능 간 누적 차이로 정의된다.
  • 모델 파라미터의 불확실성에 의해 탐색이 이끌리는 것을 보장하기 위해 톰슨 샘플링 원리를 MPC에 통합한다.
  • 반복적 또는 근사 동적 프로그래밍을 피하기 위해 각 에피소드당 하나의 MPC 해를 사용함으로써 표준 MPC의 계산 복잡도를 유지한다.

실험 결과

연구 질문

  • RQ1상태 및 입력 제약 조건이 존재하는 알려지지 않은 동역학 시스템에 대해 기반 학습 MPC에서 탐색과 이용을 효과적으로 균형 잡을 수 있는가?
  • RQ2MPC에서의 후행 표본 추출이 비선형 시스템에 대해 이론적 손실 한계를 제공하면서도 계산적으로 타당한가?
  • RQ3과정 노이즈와 측정 노이즈는 제안된 베이지안 MPC 프레임워크의 학습 성능에 어떤 영향을 미치는가?
  • RQ4비선형성이 높은 시스템에서 불확실한 동역학과 목표를 갖는 상황에서 이 방법은 실제로 얼마나 잘 작동하는가?
  • RQ5손실 한계는 모델 불확실성과 시스템의 정규성에 따라 어떻게 척도화되는가를 공식적으로 유도하고 증명할 수 있는가?

주요 결과

  • 제안된 베이지안 MPC 방법은 과정 노이즈와 측정 노이즈, 그리고 기대 비용-다음 함수의 정규성에 따라 스케일링되는 유한 시간 손실 한계를 달성한다.
  • 수치 예제에서 중앙값 손실은 첫 15개의 학습 에피소드 내에 급격히 감소하여 거의 최적의 제어 성능로의 빠른 수렴을 보였다.
  • 손실 한계는 비용 함수의 연장 변수를 통해 누적 예상 제약 위반을 포함하여 통합된 성능 지표를 제공한다.
  • 6개 상태, 2개 입력, 불확실한 파라미터를 갖는 매우 비선형적인 자동차 트레일러 시스템에서, 단지 250개의 학습 에피소드를 사용하여 실용적인 효율성을 입증하였다.
  • 이론적 결과는 각 에피소드에서 상태와 목적이 유한함을 가정하더라도 성립하며, 이는 MPC의 본질적 제약 조건 만족 특성에 의해 실질적으로 보장된다.
  • 이 방법은 표준 MPC 솔버를 직접 사용할 수 있도록 하여 맞춤형 또는 계산 비용이 큰 알고리즘의 필요성을 피할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.