[논문 리뷰] Learning Constrained Adaptive Differentiable Predictive Control Policies With Guarantees
이 논문은 자동 미분를 사용하여 선형 시스템에 대한 제약 조건이 있는 신경망 제어 정책을 학습하는 Differentiable Predictive Control(DPC)를 소개한다. DPC는 미분 가능한 닫힘 루프 동역학 모델을 통해 직접 정책 기울기를 계산하며, 이로 인해 안정적이고 제약 조건을 만족하는 정책을 오프라인, 비지도 학습 방식으로 학습할 수 있다. 이는 전통적인 MPC 및 강화학습 기반 방법보다 확장성, 샘플 효율성, 계산 속도 면에서 뛰어나며 전문가의 지도 데이터가 필요로 하지 않는다.
We present differentiable predictive control (DPC), a method for learning constrained neural control policies for linear systems with probabilistic performance guarantees. We employ automatic differentiation to obtain direct policy gradients by backpropagating the model predictive control (MPC) loss function and constraints penalties through a differentiable closed-loop system dynamics model. We demonstrate that the proposed method can learn parametric constrained control policies to stabilize systems with unstable dynamics, track time-varying references, and satisfy nonlinear state and input constraints. In contrast with imitation learning-based approaches, our method does not depend on a supervisory controller. Most importantly, we demonstrate that, without losing performance, our method is scalable and computationally more efficient than implicit, explicit, and approximate MPC. Under review at IEEE Transactions on Automatic Control.
연구 동기 및 목표
- 전문가의 지도 데이터나 온라인 최적화 없이도 확장성 있고, 미분 가능한 방법을 통해 명시적이고 제약 조건이 있는 제어 정책을 학습하는 것.
- 학습된 신경망 제어 정책에 대해 닫힘 루프 안정성과 제약 조건 이행 보장에 대한 확률적 보장을 제공하는 것.
- 기존 MPC의 계산적 한계와 모델 기반 강화학습의 데이터 비효율성 문제를 해결하는 것.
- 자동 미분를 통해 시스템 동역학과 제어 정책을 종합적으로 학습하는 엣지 투 엣지 학습을 가능하게 하는 것.
- 암시적, 명시적, 근사 MPC 방법과 비교해 샘플 효율성, 학습 속도, 실행 시간 면에서 뛰어난 성능을 보여주는 것.
제안 방법
- 자동 미분(AD)를 사용하여 모델 예측 제어(MPC) 문제를 미분 가능한 계산 그래프로 표현함으로써, MPC 손실과 제약 조건 페널티를 통해 역전파를 수행한다.
- 예측 수평선 동안 시스템 롤아웃을 기반으로 직접 정책 기울기를 계산하여, 확률적 경사 하강법을 사용해 오프라인으로 신경망 제어 정책을 학습한다.
- 닫힘 루프 시스템 동역학을 미분 가능한 신경망으로 모델링함으로써, 제어 정책과 시스템 모델을 전방향으로 전파하는 엔드 투 엔드 역전파를 가능하게 한다.
- 샘플된 시스템 롤아웃 기반으로 허프딩 부등식을 사용하여 안정성과 제약 조건 이행에 대한 확률적 보장을 유도한다.
- 선형 시스템에 대해 신경망 정책을 적용할 때 수축 조건과 반복 함수 정리(Banach fixed point theorem)를 활용하여 안정성을 보장한다.
- 실시간 최적화 솔버를 사용하지 않기 때문에, 명시적이고 폐쇄형 형태의 제어 정책을 학습함으로써 빠른 추론과 메모리 사용 감소를 달성한다.
실험 결과
연구 질문
- RQ1차별 가능한 프로그래밍을 사용하여 감독 제어기 없이 선형 시스템에 대해 명시적이고 제약 조건이 있는 제어 정책을 학습할 수 있는가?
- RQ2제안된 방법이 식물-모델 일치를 기반으로 하지 않고도 닫힘 루프 안정성과 제약 조건 이행에 대한 확률적 보장을 제공할 수 있는가?
- RQ3DPC의 샘플 효율성과 학습 속도는 모델 기반 강화학습 및 암시적 강화학습 기반 근사 MPC와 비교해 어떻게 되는가?
- RQ4다중 매개변수 프로그래밍 기반 명시적 MPC보다 DPC가 더 효율적으로 확장될 수 있는가?
- RQ5암시적 MPC와 비교해 DPC는 계산 및 메모리 오버헤드를 줄이면서도 성능을 유지할 수 있는가?
주요 결과
- DPC는 제한된 데이터로도 LQR 및 MPC와 유사한 성능을 보이며, 불안정한 선형 시스템에 대해 안정적인 신경망 제어 정책을 학습했다.
- DPC는 모델 기반 강화학습보다 더 높은 샘플 효율성을 보였으며, 최적 성능에 도달하기 위해 더 적은 학습 샘플이 필요했다.
- DPC는 암시적 MPC 기반의 이mitation learning 기반 근사 MPC보다 빠른 학습 속도를 보였으며, 정책 품질을 유지하거나 향상시키면서 학습 시간을 단축시켰다.
- DPC는 실시간 최적화 솔버를 사용하는 암시적 MPC보다 더 빠른 실행 속도를 보였다.
- DPC는 명시적 MPC보다 훨씬 적은 메모리 사용량을 요구하여 더 큰 시스템에 대해 더 확장 가능했다.
- empirical risk 평가를 통해 제약 조건 이행 및 안정성에 대한 확률적 보장이 검증되었으며, DPC는 5,000개의 학습 샘플에서 평균 97.9%의 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.