[논문 리뷰] Deep Model Predictive Control with Stability Guarantees
이 논문은 비선형이며 제어선형인 이산시간 시스템에 대해 구조화되지 않은 유한한 불확실성을 가진 딥러닝 강화 모델 예측 제어(Deep-MPC) 프레임워크를 제안한다. 이중 시간스케일 신경망 적응과 튜브 기반 MPC를 통합함으로써, 검증 가능한 조건 하에서 입력-상태 안정성, 순차적 탐색 가능성, 그리고 원점 수렴을 보장하며 학습 일시적 동안에도 제약 조건을 유지한다.
This paper presents a deep learning based model predictive control algorithm for control affine nonlinear discrete time systems with matched and bounded state dependent uncertainties of unknown structure. Since the structure of uncertainties is not known, a deep learning based adaptive mechanism is utilized to mitigate disturbances. In order to avoid any unwanted behavior during the learning phase, a tube based model predictive controller is employed, which ensures satisfaction of constraints and input-to-state stability of the closed-loop states. In addition, the proposed approach guarantees the convergence of states to origin under certain verifiable conditions. To ensure stability and undesirable learning transients, a dual-timescale adaptation mechanism is proposed, where the weights of the last layer of the neural network are updated each time instant while the inner layers are trained on a slower timescale using training data collected online and selectively stored in a buffer on the basis of singular value maximization criterion. Our results are validated through numerical experiments on wing-rock dynamics. These results indicate that the proposed deep-MPC architecture is effective in learning to control safety critical systems without suffering instability drawbacks.
연구 동기 및 목표
- 안전이 중요한 시스템에서 딥러닝 기반 제어의 학습 일시적 동안 안정성과 제약 조건 이행을 확보하는 도전 과제를 해결한다.
- 학습 과정에서 불안정성이나 제약 위반을 초래할 수 있는 순수 데이터 기반 제어기의 한계를 극복한다.
- 함수 근사와 실시간 최적화의 이점을 살리면서도 안전성을 유지하기 위해 깊은 신경망(DNN)과 모델 예측 제어(MPC)를 통합한다.
- 빠른 출력층 학습과 느린 은닉층 학습을 분리하기 위한 이중 시간스케일 적응 메커니즘을 개발하여 실시간 실행 가능성을 확보한다.
- 리아푸노프 기반 분석과 외란 제거 능력을 갖춘 튜브 기반 MPC 설정을 통해 점점 줄어드는 안정성과 순차적 탐색 가능성을 보장한다.
제안 방법
- 알려지지 않은 구조화되지 않은 시스템 불확실성을 근사하기 위해 고정된 은닉층과 적응 가능한 출력층 가중치를 갖는 깊은 신경망(DNN)을 사용한다.
- 이중 시간스케일 적응을 구현: 출력층 가중치는 매 시간 단위마다 이산 적응 법칙을 사용해 업데이트하고, 은닉층 가중치는 버퍼에 저장된 온라인 데이터를 사용해 천천히 업데이트한다.
- 학습 데이터를 효율적으로 선택하기 위해 특이값 최대화 기준을 사용하여 버퍼에 저장함으로써 샘플 효율성과 학습 품질을 향상시킨다.
- DNN의 외란 추정치를 튜브 기반 MPC 프레임워크에 통합하여 순차적 탐색 가능성과 폐쇄형 시스템의 입력-상태 안정성(ISS)을 보장한다.
- MPC 비용과 DNN 가중치 오차를 조합한 리아푸노프 함수를 구성하여 수렴성과 안정성을 증명하고, 전체 시스템에 대한 복합 리아푸노프 함수를 사용한다.
- 노미널 궤적을 둘러싼 강건한 튜브를 통해 제약 조건을 강제하며, 튜브 크기는 DNN의 근사 오차와 시스템 불확실성의 범위로 제한된다.
실험 결과
연구 질문
- RQ1딥러닝 기반 제어기가 MPC와 통합되어 비선형 시스템의 구조화되지 않은 불확실성이 있는 상황에서 온라인 학습 중 안정성과 제약 조건 이행을 보장할 수 있는가?
- RQ2학습 과정을 실시간 제어에서 분리하여 안전이 중요한 시스템에서 불안정성과 실행 가능성 문제를 방지할 수 있는가?
- RQ3폐쇄형 시스템 상태가 원점으로 수렴하는 데 필요한 조건은 무엇인가? 이는 순차적 탐색 가능성과 입력-상태 안정성도 유지한다.
- RQ4온라인 학습 데이터를 효율적으로 선택하고 저장하여 DNN의 일반화 능력을 향상시키면서도 안전성을 해치지 않을 수 있는가?
- RQ5일치하는 유한한 상태 의존적 불확실성이 있는 시스템에 대해, 딥러닝과 MPC를 동시에 사용하여 증명 가능하게 안정적이고 안전한 제어 아키텍처를 설계할 수 있는가?
주요 결과
- 제안된 딥-MPC 프레임워크는 유한하고 구조화되지 않은 불확실성 하에서 폐쇄형 시스템의 입력-상태 안정성(ISS)을 보장한다.
- 튜브 기반 설정을 통해 DNN의 외란 추정 오차를 고려함으로써 MPC 최적화의 순차적 탐색 가능성이 보장된다.
- 시스템 상태는 복합 리아푸노프 함수를 통해 증명된 상태 노름의 지수 감소를 통해 점점 줄어들며 원점으로 점점 수렴한다.
- 이중 시간스케일 적응 메커니즘은 매 시간 단위마다 출력층 가중치를 업데이트하고, 온라인 데이터의 정제된 버퍼를 사용해 은닉층 가중치를 천천히 학습시킴으로써 실시간 실행 가능성을 보장한다.
- 윙락 역학 시스템에 대한 수치 실험은 복잡한 비선형 역학을 효과적으로 학습하면서도 불안정성이나 제약 위반 없이 수행됨을 보여준다.
- 이론적 분석은 유도된 안정성 조건 하에서 상태 노름의 네 번째 거듭제곱의 합이 유계임을 확인하여 원점으로의 점진적 수렴을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.