Skip to main content
QUICK REVIEW

[논문 리뷰] Model Predictive Control via On-Policy Imitation Learning

Kwangjun Ahn, Zakaria Mhammedi|arXiv (Cornell University)|2022. 10. 17.
Advanced Control Systems Optimization인용 수 4
한 줄 요약

이 논문은 제약 조건이 있는 선형 시스템에 대해 명시적 모델 예측 제어(MPC) 정책을 학습하는 데 있어 데이터 효율성과 성능을 향상시키는 온정책 일관성 학습 방법인 Forward-Switch를 제안한다. MPC의 구조를 활용하고, 학습된 시간 영역 이후에 LQR로 전환함으로써 안정적이고 제약 조건을 만족하는 제어를 달성하며, 비최적 비용이 MPC 성능에 가까워진다. 시뮬레이션을 통해 행동 복제와 표준 전방 학습에 비해 뛰어난 샘플 효율성을 입증하였다.

ABSTRACT

In this paper, we leverage the rapid advances in imitation learning, a topic of intense recent focus in the Reinforcement Learning (RL) literature, to develop new sample complexity results and performance guarantees for data-driven Model Predictive Control (MPC) for constrained linear systems. In its simplest form, imitation learning is an approach that tries to learn an expert policy by querying samples from an expert. Recent approaches to data-driven MPC have used the simplest form of imitation learning known as behavior cloning to learn controllers that mimic the performance of MPC by online sampling of the trajectories of the closed-loop MPC system. Behavior cloning, however, is a method that is known to be data inefficient and suffer from distribution shifts. As an alternative, we develop a variant of the forward training algorithm which is an on-policy imitation learning method proposed by Ross et al. (2010). Our algorithm uses the structure of constrained linear MPC, and our analysis uses the properties of the explicit MPC solution to theoretically bound the number of online MPC trajectories needed to achieve optimal performance. We validate our results through simulations and show that the forward training algorithm is indeed superior to behavior cloning when applied to MPC.

연구 동기 및 목표

  • 행동 복제에서 MPC 컨트롤러를 일관성 학습할 때 발생하는 데이터 비효율성과 분포 이탈 문제를 해결하기 위해.
  • 실시간 MPC 피드백이 있는 제약 조건이 있는 선형 시스템에 특화된 샘플 효율적인 상호작용형 일관성 학습 방법을 개발하기 위해.
  • 학습된 컨트롤러에 대해 안정성, 제약 조건 이행 및 비용 비최적성에 이론적 보장을 제공하기 위해.
  • 오차 누적 문제를 줄이는 온정책 데이터 수집을 가능하게 함으로써 비상호작용형 일관성 학습을 향상시키기 위해.
  • 시뮬레이션을 통해 행동 복제와 표준 전방 학습에 비해 본 방법의 우수성을 검증하기 위해.

제안 방법

  • 장기 시간 영역과 제약 조건이 있는 선형 시스템을 다룰 수 있도록, 정책 기반 강화 학습 기반의 온정책 일관성 학습 방법인 전방 학습 알고리즘을 MPC 응용에 적응시키기 위해 수정한다.
  • 데이터로부터 추정한 시간 영역 이후에 MPC에서 LQR 제어로 전환하는 스위칭 메커니즘을 도입한다. 이는 시간 불변 선형 시스템에서 MPC가 LQR로 수렴한다는 사실을 활용한다.
  • 일관성 과정의 강건성을 향상시키고 분포 이탈에 대한 민감도를 낮추기 위해 전문가 정책으로 강건한 MPC를 사용한다.
  • 시스템과의 상호작용을 통해 MPC 컨트롤러와 피드백을 유지하면서 온라인 트레이젝터리를 수집함으로써, 훈련 분포가 배포 분포와 일치하도록 보장한다.
  • 고차원 통계 및 통계학적 학습 이론을 활용하여 MPC 트레이젝터리의 필요 수를 이론적으로 한정함으로써 최적 성능로의 수렴을 보장한다.
  • LQR 하에서 시스템이 양의 불변 집합에 진입하는 시점인 시간 영역 $\hat{\tau}_{\infty}$ 를 추정함으로써 안전한 스위칭을 가능하게 한다.

실험 결과

연구 질문

  • RQ1온정책 일관성 학습이 행동 복제에 비해 MPC 정책을 학습할 때 분포 이탈과 오차 누적 문제를 줄일 수 있는가?
  • RQ2선형 시스템을 안정화하고 제약 조건을 만족시키기 위해 일관성 학습을 통해 컨트롤러를 학습하기 위해 필요한 이론적 샘플 복잡도는 얼마인가?
  • RQ3전방 학습 알고리즘은 어떻게 장기 시간 영역 MPC 문제와 상태, 입력 제약 조건을 다룰 수 있도록 적응시킬 수 있는가?
  • RQ4데이터로 추정한 시간 영역 이후에 LQR로 전환하는 것이 일관성 기반 MPC에서 샘플 효율성과 성능을 향상시키는가?
  • RQ5학습된 컨트롤러는 높은 확률로 MPC 성능에 가까운 비용 비최적성을 달성할 수 있으며, 이 비최적성에 대한 이론적 한계는 무엇인가?

주요 결과

  • d=5 시스템에서 Forward-Switch는 180개의 MPC 시범 데이터만으로 평균 정규화된 비용-도달 비용을 약 1.034로 달성하여 표준 전방 학습에 비해 뚜렷이 뛰어난 성능을 보였다.
  • 210개의 시범 데이터를 사용한 표준 전방 학습은 평균 정규화된 비용-도달 비용이 약 35로 나타나, 분포 이탈로 인한 심각한 성능 저하를 보였다.
  • 제안된 방법은 비용 비최적성을 최적 성능의 3.4% 이내로 줄여, 제한된 데이터로도 거의 최적 제어를 달성함을 보였다.
  • Forward-Switch는 동일한 12단계 시간 영역을 사용함에도 불구하고 행동 복제 대비 더 높은 샘플 효율성과 강건성을 보였다.
  • 이론적 분석을 통해 샘플 복잡도의 한계와 안정성, 제약 조건 이행 보장을 제공하였으며, 이는 이전의 일관성 기반 MPC 방법에서 부족했던 요소였다.
  • d=5 시스템에서 추정된 시간 영역 $\hat{\tau}_{\infty} = 12$ 는 LQR로의 안전한 스위칭을 보장하는 데 충분했으며, 스위칭 전략의 실용성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.