Skip to main content
QUICK REVIEW

[논문 리뷰] Infinite-Horizon Differentiable Model Predictive Control

Sebastian East, Marco Gallieri|arXiv (Cornell University)|2020. 01. 07.
Advanced Control Systems Optimization참고 문헌 27인용 수 6
한 줄 요약

이 논문은 이산시간 대칭 행렬 방정식(DARE)을 통해 닫힘 루프 안정성을 보장하는 미분 가능하고 무한 수렴 시간을 갖는 선형 제어 최적화(MPC) 프레임워크를 제안한다. DARE 해의 해석적 기울기를 유도함으로써, 이론적 기울기 기반 학습을 가능하게 하면서도 증강 라그랑지안과 사전 안정화 제어를 통해 경계 조건을 강제로 이행함으로써 짧은 예측 수렴 시간에도 안정적이고 강건한 제어 성능을 달성한다.

ABSTRACT

This paper proposes a differentiable linear quadratic Model Predictive Control (MPC) framework for safe imitation learning. The infinite-horizon cost is enforced using a terminal cost function obtained from the discrete-time algebraic Riccati equation (DARE), so that the learned controller can be proven to be stabilizing in closed-loop. A central contribution is the derivation of the analytical derivative of the solution of the DARE, thereby allowing the use of differentiation-based learning methods. A further contribution is the structure of the MPC optimization problem: an augmented Lagrangian method ensures that the MPC optimization is feasible throughout training whilst enforcing hard constraints on state and input, and a pre-stabilizing controller ensures that the MPC solution and derivatives are accurate at each iteration. The learning capabilities of the framework are demonstrated in a set of numerical studies.

연구 동기 및 목표

  • 안정성 보장이 보장되는 이산 시간 MPC 프레임워크를 개발하여 안전이 중요한 시스템에서의 이민 학습에 적용한다.
  • DARE 해의 해석적 도함수를 유도함으로써 MPC 비용 함수의 기울기 기반 최적화를 가능하게 한다.
  • 증강 라그랑지안 방법을 사용하여 훈련 중에 상태 및 입력 경계 조건을 강력하게 이행한다.
  • 사전 안정화 선형 피드백 제어기를 도입하여 MPC 최적화의 수치 정확도와 조건 수를 향상시킨다.
  • 짧은 유한 예측 수렴 시간이 무한 수렴 시간 성능과 안정성 보장을 달성할 수 있음을 입증한다.

제안 방법

  • 무한 수렴 시간 비용은 이산 시간 대칭 행렬 방정식(DARE)의 해로부터 유도되며, 이로써 닫힘 루프에서 안정성 특성을 확보한다.
  • 행렬 미적분을 사용하여 DARE 해의 해석적 도함수를 유도함으로써 정적 해를 통해 역전파가 가능해진다.
  • 수치 정확도 및 QP 조건 수를 향상시키기 위해 사전 안정화 선형 상태 피드백 제어기를 적용한다.
  • MPC 최적화는 증강 라그랑지안 방법을 사용하여 상태 및 입력에 대한 경계 조건을 강제로 이행하며, 훈련 전반에 걸쳐 타당성을 보장한다.
  • 총 제어 입력은 사전 안정화 피드백에서의 변동으로 계산되어 안정성과 정확한 기울기 계산을 보장한다.
  • 미분 가능한 2차 프로그래밍(QP) 해법기를 사용하여 MPC 비용 행렬의 엔드 투 엔드 훈련을 역전파를 통해 가능하게 한다.

실험 결과

연구 질문

  • RQ1이산 시간 대칭 행렬 방정식(DARE)의 해가 완전히 미분 가능하게 만들 수 있을까? 이는 MPC에서 기울기 기반 학습을 지원할 수 있는가?
  • RQ2경계 조건이 활성화된 상태에서 훈련 중에 상태 및 입력 경계 조건을 어떻게 강력하게 이행할 수 있을까? 이는 타당성과 수렴성을 유지하는가?
  • RQ3MPC에서 짧은 유한 예측 수렴 시간이 무한 수렴 시간 안정성 및 성능 보장을 달성할 수 있는가?
  • RQ4사전 안정화 제어기는 MPC 최적화 및 기울기 계산의 수치 정확도와 조건 수를 향상시키는 데 어떤 역할을 하는가?
  • RQ5다양한 MPC 비용 행렬을 사용한 DARE 기반 종단 비용을 갖는 미분 가능한 MPC를 통해 이민 학습이 전문가 MPC 제어기의 진짜 비용 함수를 얼마나 잘 복원할 수 있는가?

주요 결과

  • 제안된 방법은 질량- 스프링-다임퍼 시스템에 대해 진짜 비용 행렬 $ Q $ 와 $ R $ 을 성공적으로 학습하였으며, 특히 더 긴 예측 수렴 시간($ N = 15, 20 $)에서 이민 손실이 낮은 수준으로 수렴하였다.
  • 차량 플라토닝 모델의 경우, 모든 학습된 제어기는 간격 유지 경계 조건과 정상 상태 간격에 대해 정확히 수렴하였으며, $ N = 5 $ 인 경우에도 경계 조건을 충족하였다.
  • 예측 오차는 $ N = 20 $ 에서 최소화되었으며, 이는 장기 예측의 정확성과 무한 수렴 시간 비용의 효과적인 활용을 시사한다. 반면 짧은 수렴 시간에서는 경계 조건이 활성화된 경우 오차가 더 커졌다.
  • DARE 해의 해석적 도함수 덕분에 안정적이고 정확한 기울기 계산이 가능하여 두 테스트 케이스 모두 국소 최소점으로 수렴하였다.
  • 증강 라그랑지안 방법은 경계 조건을 엄격히 이행하고 문제의 타당성을 유지하였으며, 경계 조건이 활성화된 상태에서도 훈련 전반에 걸쳐 효과적이었다.
  • 사전 안정화 제어기는 QP의 조건 수를 크게 향상시키고 MPC 해의 정확도 및 기울기 계산의 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.