[논문 리뷰] Differentiable Predictive Control: An MPC Alternative for Unknown Nonlinear Systems using Constrained Deep Learning.
이 논문은 알려진 동역학 모델이 필요 없이 시스템의 시계열 데이터로부터 최적의 제어 정책을 종단 간(end-to-end)으로 학습하는 데이터 기반 제어 방법인 미분 가능한 예측 제어(Differentiable Predictive Control, DPC)를 제안한다. 학습된 동역학 모델을 통해 미분 가능하게 하고, 제약 조건을 페널티 방법으로 강제함으로써, 전통적인 명시적 모델 예측 제어(explicit MPC)와 비례 제어(PI control)에 비해 우수한 참조 추적 성능과 계산 효율성을 달성하며, 기존의 명시적 MPC와는 달리 선형 스케일링을 보인다.
We present an alternative to model predictive control (MPC) for unknown nonlinear systems in low-resource embedded device settings. The structure of the presented data-driven control policy learning method, Differentiable Predictive Control (DPC), echos the structure of classical MPC, by i) using a prediction model capturing controlled system dynamics, ii) receding horizon optimal control action predictions, and iii) enforcing inequality constraints via penalty methods. However, contrary to MPC, the presented control architecture does not require the system dynamics model to synthesize the control policy. Instead, a dynamics model is learned end-to-end from time-series measurements of the system dynamics in the off-policy setup. The control policy is then optimized via gradient descent by differentiating the closed-loop system dynamics model. The proposed architecture allows to train the control policy to track the distribution of reference signals and handle time-varying inequality constraints. We experimentally demonstrate that it is possible to train generalizing constrained optimal control policies purely based on the observations of the dynamics of the unknown nonlinear system. The proposed control method is applied to a laboratory device in embedded implementation using a Raspberry Pi micro-controller. We demonstrate superior reference tracking control performance compared to classical explicit MPC and a baseline PI controller, and pivotal efficiency gains in online computational demands, memory requirements, policy complexity, and construction. Beyond improved control performance, the DPC method scales linearly compared to exponential scalability of the explicit MPC solved via multiparametric programming, hence, opening doors for applications in nonlinear systems with a large number of variables and fast sampling rates which are beyond the reach of classical explicit MPC.
연구 동기 및 목표
- 모델이 명시적으로 제공되지 않은 비선형 시스템을 위한 제어 방법을 개발하여, 시스템 모델을 명시적으로 필요로 하거나 복잡한 온라인 최적화를 피하고자 한다.
- 저자원 임베디드 장치(예: Raspberry Pi)에서 실시간 제어를 가능하게 하기 위해 온라인 계산 및 메모리 요구량을 줄임으로써, 저비용 하드웨어에서의 구현 가능성을 확보하고자 한다.
- 많은 변수를 가진 시스템과 빠른 샘플링 주기에서 성능을 유지하는 가용성 있는 제어 정책 학습을 실현하고자 한다.
- 종단 간 미분 가능한 최적화를 통해 시간에 따라 변화하는 부등식 제약 조건과 참조 추적을 지원하고자 한다.
- 시스템 차원 수에 따라 지수적 복잡도를 보이는 전통적인 명시적 모델 예측 제어(MPC)의 대안이 되는, 선형 스케일링을 보이는 방법을 제공하고자 한다.
제안 방법
- DPC는 시스템의 행동에 대한 오프-폴리시(off-policy) 시계열 데이터로부터 학습된, 미분 가능한 종단 간 학습된 동역학 모델을 사용한다.
- 제어 정책은 닫힌 루프 동역학 모델을 통해 역전파(backpropagation)하면서 기울기 하강법을 통해 최적화되며, 직접적인 정책 학습이 가능해진다.
- 전통적인 MPC와 유사하게 향후 제어 행동을 예측하기 위해 후퇴하는 수평(Receding horizon) 프레임워크를 사용하지만, 온라인 QP 해법이 필요하지 않다.
- 부등식 제약 조건은 손실 함수에 통합된 페널티 방법을 통해 강제되며, 부드러운 제약 조건 처리가 가능해진다.
- 종단 간 훈련을 통해 예측 불가능한 참조 신호와 시간에 따라 변화하는 제약 조건에 일반화할 수 있다.
- 임베디드 시스템에의 배포를 고려하여 설계되어, 메모리 점유율과 온라인 계산을 최소화한다.
실험 결과
연구 질문
- RQ1시스템의 동역학에 대한 사전 지식 없이 시스템 관측 데이터로부터만 제어 정책을 학습할 수 있는가?
- RQ2신경망 기반 동역학 모델을 통한 미분 가능한 학습이 알려지지 않은 비선형 시스템에서 기존의 명시적 MPC나 PI 제어기보다 더 우수한 제어 성능을 달성할 수 있는가?
- RQ3전통적인 명시적 MPC가 차원 수에 따라 지수적 복잡도를 보이는 데 비해, 제안된 방법은 시스템 차원 수에 대해 효율적으로 스케일링되는가?
- RQ4이 방법은 데이터 기반의 종단 간 훈련 가능 방식으로 시간에 따라 변화하는 참조 신호와 제약 조건을 처리할 수 있는가?
- RQ5이 방법은 온라인 계산 오버헤드를 최소화하면서 저자원 임베디드 플랫폼에 배포 가능한가?
주요 결과
- 실험적 검증에서 DPC는 전통적인 명시적 MPC와 기본 PI 제어기 모두에 비해 뛰어난 참조 추적 성능을 보였다.
- 명시적 MPC에 비해 온라인 계산 요구량, 메모리 요구량, 정책 복잡도 측면에서 뚜렷한 효율성 향상을 보였다.
- DPC는 시스템 차원 수에 대해 선형 스케일링을 보이며, 다중매개변수 프로그래밍을 통한 명시적 MPC의 지수적 스케일링과 대비된다.
- 학습된 제어 정책은 종단 간 훈련을 통해 예측 불가능한 참조 신호에 일반화되고 시간에 따라 변화하는 부등식 제약 조건에 적응한다.
- Raspberry Pi 마이크로컨트롤러에 성공적으로 배포되어, 임베디드 실시간 제어 응용 분야에서의 실현 가능성을 확인했다.
- 미분 가능한 동역학 학습을 통해 분석적 시스템 모델이 필요 없이 기울기 기반 최적화를 통한 제어 정책 최적화가 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.