Skip to main content
QUICK REVIEW

[논문 리뷰] Near-Optimal Rapid MPC using Neural Networks: A Primal-Dual Policy Learning Framework

Xiaojing Zhang, Monimoy Bujarbaruah|arXiv (Cornell University)|2019. 12. 09.
Advanced Control Systems Optimization참고 문헌 64인용 수 7
한 줄 요약

이 논문은 선형 매개변수 변화 시스템에 대해 명시적 모델 예측 제어(MPC) 법칙을 깊이 신경망으로 근사하는 원시-이중 정책 학습 프레임워크를 제안한다. 이는 높은 확률로 타당성과 근사 최적성 보장을 한다. 원시 제어 정책과 이중 최적성 증명서를 함께 학습함으로써 추론 시점에 실시간으로 부분최적성 검증이 가능해지며, 데스크톱에서는 최대 62배, 자동차용 전자 제어 장치(ECU)에서는 10배의 속도 향상을 이룩했고, 실험에서 백업 제어기 작동이 전혀 발생하지 않아 근사 최적 성능 유지를 하였다.

ABSTRACT

In this paper, we propose a novel framework for approximating the explicit MPC policy for linear parameter-varying systems using supervised learning. Our learning scheme guarantees feasibility and near-optimality of the approximated MPC policy with high probability. Furthermore, in contrast to most existing approaches that only learn the MPC policy, we also learn the "dual policy", which enables us to keep a check on the approximated MPC's optimality online during the control process. If the check deems the control input from the approximated MPC policy safe and near-optimal, then it is applied to the plant, otherwise a backup controller is invoked, thus filtering out (severely) suboptimal control inputs. The backup controller is only invoked with a bounded (low) probability, where the exact probability level can be chosen by the user. Since our framework does not require solving any optimization problem during the control process, it enables the deployment of MPC on resource-constrained systems. Specifically, we illustrate the utility of the proposed framework on a vehicle dynamics control problem. Compared to online optimization methods, we demonstrate a speedup of up to 62x on a desktop computer and 10x on an automotive-grade electronic control unit, while maintaining a high control performance.

연구 동기 및 목표

  • 자신감 있는 임베디드 시스템, 예를 들어 자동차용 ECU와 같이 자원이 제한된 환경에서 계산 비용이 큰 MPC를 구현하는 데 도전한다.
  • 기존의 함수 근사 방법의 한계를 극복하기 위해, 타당성과 근사 최적성 보장을 높은 확률로 보장하는 학습 기반 MPC 근사 기법을 개발한다.
  • 실시간 온라인 검증을 가능하게 하는 이중 정책을 도입하여, 배치 시에 원시 정책의 부분최적성에 대한 보증을 제공함으로써 안전성을 확보한다.
  • 온라인 최적화를 제거함으로써 런타임에 대한 계산 오버헤드를 줄여 저전력 하드웨어에서도 실시간 제어를 가능하게 한다.
  • 고속도 및 고정밀도 요구사항을 가진 실제 차량 동역학 제어 응용 분야에서 프레임워크의 효과성을 입증한다.

제안 방법

  • 프레임워크는 명시적 MPC에서 유도된 상태-제어 쌍 데이터셋을 기반으로 원시-이중 정책 학습을 랜덤화된 최적화 문제로 공식화한다.
  • 통계적 학습 이론과 시나리오 최적화를 활용하여, 타당성과 근사 최적성 보장을 높은 확률로 보장하는 데 필요한 표본 크기의 하한을 유도한다.
  • 이중 정책는 MPC 최적화 문제의 이중 변수에서 유도되며, 원시 정책 출력의 부분최적성에 대한 실시간 증명서로 기능한다.
  • 이중 정책는 계산적으로 경량이며 온라인 검증이 가능하다: 부분최적성의 초과가 사용자 정의 임계값을 초과하면 백업 제어기가 작동한다.
  • 원시 정책는 오프라인 MPC 해를 기반으로 한 지도 학습을 통해 깊이 신경망(DNN) 또는 기저 함수의 선형 조합으로 구현된다.
  • 이 방법은 백업 제어기 작동 확률가 유한하며, 사용자가 조정할 수 있어 속도를 희생시키지 않고도 안전성을 보장한다.

실험 결과

연구 질문

  • RQ1신경망 기반의 명시적 MPC 근사는 높은 확률로 타당성과 근사 최적성을 보장할 수 있는가?
  • RQ2최적화 문제를 풀지 않고도 원시 정책의 부분최적성에 대한 실시간, 온라인 검증이 가능한 이중 정책을 학습할 수 있는가?
  • RQ3제안된 프레임워크는 임베디드 시스템에서 높은 성능을 유지하면서도 상당한 속도 향상을 이룰 수 있는가?
  • RQ4실제로 이중 정책의 검증 기능은 백업 제어기 의존도를 얼마나 줄이는가?
  • RQ5실시간 MPC 구현에서 근사 정확도, 계산 효율성, 메모리 사용량 간의 상호 상충 관계는 어떠한가?

주요 결과

  • 제안된 프레임워크는 CVXGEN 솔버 대비 데스크톱에서 최대 62배, 자동차용 전자 제어 장치(ECU)에서는 10배의 속도 향상을 달성했다.
  • ECU에서 DNN-ReLU 제어기의 평균 계산 시간은 1.8ms로, 100Hz에서 실시간 작동이 가능했고, CVXGEN는 18.7ms가 소요되었다.
  • DNN-ReLU 제어기는 평균 상대적 원시 부분최적성 수준이 뿐만 아니라 실질적으로 근사 최적성을 보여주었다.
  • 버클리 자율주행차에서 수행한 전체 12초 분량의 차선 이탈 실험 기간 동안 백업 제어기가 한 번도 작동하지 않아 높은 신뢰성과 안전성을 입증했다.
  • DNN-ReLU 모델의 메모리 사용량은 114KB로, CVXGEN의 322KB 대비 크게 감소하여 임베디드 배치에 적합하다.
  • 이론적 분석 결과, 백업 제어기 작동 확률가 유한하며, 사용자가 조정 가능하므로 고신뢰도 안전성 보장을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.