Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Stochastic Parametric Differentiable Predictive Control Policies

Ján Drgoňa, Sayak Mukherjee|arXiv (Cornell University)|2022. 03. 02.
Advanced Control Systems Optimization인용 수 6
한 줄 요약

이 논문은 추가적인 불확실성과 비선형 확률 제약 조건을 가진 선형 시스템에서의 스토크라스틱 모델 예측 제어를 위한 확장 가능한 오프라인 학습 방법인 Stochastic Parametric Differentiable Predictive Control (SP-DPC)를 제안한다. 스토크라스틱 최적 제어 문제의 결정론적 근사치를 설정하고, 닫힌 루프 롤아웃을 통해 자동 미분을 활용함으로써, 신경망을 통한 효율적이고 미분 가능한 정책 최적화를 가능하게 한다. 이로 인해 온라인 비선형 MPC보다 최대 10배 빠른 온라인 추론 성능을 달성하면서도 안정성과 제약 조건 이행에 대한 확률적 보장을 유지한다.

ABSTRACT

The problem of synthesizing stochastic explicit model predictive control policies is known to be quickly intractable even for systems of modest complexity when using classical control-theoretic methods. To address this challenge, we present a scalable alternative called stochastic parametric differentiable predictive control (SP-DPC) for unsupervised learning of neural control policies governing stochastic linear systems subject to nonlinear chance constraints. SP-DPC is formulated as a deterministic approximation to the stochastic parametric constrained optimal control problem. This formulation allows us to directly compute the policy gradients via automatic differentiation of the problem's value function, evaluated over sampled parameters and uncertainties. In particular, the computed expectation of the SP-DPC problem's value function is backpropagated through the closed-loop system rollouts parametrized by a known nominal system dynamics model and neural control policy which allows for direct model-based policy optimization. We provide theoretical probabilistic guarantees for policies learned via the SP-DPC method on closed-loop stability and chance constraints satisfaction. Furthermore, we demonstrate the computational efficiency and scalability of the proposed policy optimization algorithm in three numerical examples, including systems with a large number of states or subject to nonlinear constraints.

연구 동기 및 목표

  • 중간 정도의 복잡도와 불확실성을 지닌 시스템에서 전통적인 스토크라스틱 명시적 MPC의 비가역성 문제를 해결하기 위해.
  • 비선형 확률 제약 조건과 추가적인 시스템 불확실성을 처리할 수 있는 확장 가능한 오프라인 기반 학습 방법을 개발하기 위해.
  • 배포 시 온라인 솔버에 의존하지 않고도, 미분 프로그래밍과 자동 미분을 활용한 효율적 정책 최적화를 가능하게 하기 위해.
  • 학습된 정책에 대해 닫힌 루프 안정성과 확률 제약 조건 이행에 대한 이론적 확률 보장을 제공하기 위해.
  • 기존의 파라미터 기반 프로그래밍과 온라인 비선형 MPC 솔버를 뛰어넘는 계산 효율성과 확장성의 실증을 위해.

제안 방법

  • SP-DPC는 불확실성 시나리오와 파라미터 변형을 샘플링하여 스토크라스틱 파라미터 최적 제어 문제의 결정론적 근사치를 설정한다.
  • 이 방법은 SP-DPC 문제의 가치 함수의 기대값을 신경망 제어 정책과 시스템 동역학을 통해 역전파하기 위해 자동 미분을 사용한다.
  • 닫힌 루프 시스템 롤아웃은 알려진 명칭 동역학 모델과 신경망 정책을 사용하여 시뮬레이션되며, 이는 미분 가능 프로그래밍을 통한 기울기 계산을 가능하게 한다.
  • 최적화는 알고리즘 1을 사용해 오프라인으로 수행되며, 이는 1000개의 파라미터 시나리오와 시나리오당 100개의 불확실성 실현을 샘플링하여 총 100만 개의 시나리오를 포함한다.
  • 4층의 ReLU 신경망 정책이 시스템 상태와 참조 경로에서 제어 입력으로 매핑하기 위해 훈련되었으며, 총 35,140개의 파rameter를 가진다.
  • 목적 함수에는 상태 및 입력 편차, 제어 노력, 제약 위반에 대한 2차 페널티가 포함되어 있으며, 확률 제약 조건은 샘플된 시나리오를 통해 이행된다.

실험 결과

연구 질문

  • RQ1미분 가능하고 오프라인 학습 기반의 프레임워크가 추가적인 불확실성과 비선형 제약 조건을 가진 시스템으로 스토크라스틱 모델 예측 제어를 효과적으로 확장할 수 있는가?
  • RQ2학습된 SP-DPC 신경망 정책의 온라인 추론 시간은 온라인 비선형 MPC 솔버 대비 얼마나 효율적인가?
  • RQ3SP-DPC 방법은 감독 데이터에 의존하지 않고도 닫힌 루프 안정성과 확률 제약 조건 이행에 대해 엄밀한 확률 보장을 제공할 수 있는가?
  • RQ4SP-DPC는 불안정한 시스템의 안정화, 불확실성 하에서의 스토크라스틱 기준 추적, 장애물 회피와 같은 복잡한 제어 작업을 얼마나 잘 처리할 수 있는가?
  • RQ5샘플링 전략과 시나리오 수의 영향은 SP-DPC 정책 최적화의 성능과 확장성에 어떤 영향을 미치는가?

주요 결과

  • SP-DPC 신경망 정책은 평균 온라인 추론 시간이 2.555ms를 기록하여 온라인 비선형 MPC 솔버(평균 28.362ms)보다 10배 빠른 성능을 달성했다.
  • 최악의 경우 SP-DPC 정책은 온라인 MPC 솔버보다 5배 빠르게 작동했으며, 최대 추론 시간은 10.144ms 대비 53.340ms였다.
  • 알고리즘 1을 통한 훈련 과정은 1000 에포크 동안 17.47분이 소요되어 대규모 시나리오 샘플링을 통한 오프라인 최적화의 가능성을 입증했다.
  • 이 방법은 불안정한 시스템의 안정화, 스토크라스틱 기준 추적, 불확실성 하에서 비선형 제약 조건을 가진 파라미터 기반 장애물 회피를 성공적으로 처리했다.
  • 이론적으로 유도된 바와 같이, SP-DPC 정책은 제약 조건 이행과 닫힌 루프 안정성에 대한 확률 보장을 유지했으며, 시뮬레이션을 통해 검증되었다.
  • 이 접근법은 기존의 파라미터 기반 프로그래밍 솔버를 뛰어넘고 실시간 성능 면에서 온라인 솔버를 능가하므로 고차원 또는 복잡한 시스템에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.