Skip to main content
QUICK REVIEW

[論文レビュー] Model Predictive Control via On-Policy Imitation Learning

Kwangjun Ahn, Zakaria Mhammedi|arXiv (Cornell University)|Oct 17, 2022
Advanced Control Systems Optimization被引用数 4
ひとこと要約

本稿では、制約付き線形系に対する明示的Model Predictive Control (MPC)ポリシーを学習する際のデータ効率性と性能を向上させる、オンポリシーの模倣学習手法であるForward-Switchを提案する。MPCの構造を活用し、学習された時間区間後にLQRに切り替えることで、安定で制約を満たす制御を達成し、サブオプティマルなコストがMPC性能に近づく。シミュレーションにより、行動コーディングや標準的なフォワードトレーニングに比べて優れたサンプル効率性が実証された。

ABSTRACT

In this paper, we leverage the rapid advances in imitation learning, a topic of intense recent focus in the Reinforcement Learning (RL) literature, to develop new sample complexity results and performance guarantees for data-driven Model Predictive Control (MPC) for constrained linear systems. In its simplest form, imitation learning is an approach that tries to learn an expert policy by querying samples from an expert. Recent approaches to data-driven MPC have used the simplest form of imitation learning known as behavior cloning to learn controllers that mimic the performance of MPC by online sampling of the trajectories of the closed-loop MPC system. Behavior cloning, however, is a method that is known to be data inefficient and suffer from distribution shifts. As an alternative, we develop a variant of the forward training algorithm which is an on-policy imitation learning method proposed by Ross et al. (2010). Our algorithm uses the structure of constrained linear MPC, and our analysis uses the properties of the explicit MPC solution to theoretically bound the number of online MPC trajectories needed to achieve optimal performance. We validate our results through simulations and show that the forward training algorithm is indeed superior to behavior cloning when applied to MPC.

研究の動機と目的

  • 行動コーディングにおいてMPCコントローラーを模倣する際のデータ非効率性と分布シフト問題を解消すること。
  • 制約付き線形系に特化した、オンラインMPCフィードバックを伴う、サンプル効率的でインタラクティブな模倣学習手法の開発。
  • 学習済みコントローラーに対する安定性・制約満足・コストサブオプティマル性に関する理論的保証の提供。
  • 誤差の累積を低減するオンポリシーのデータ収集を可能にすることで、非インタラクティブな模倣学習を改善すること。
  • シミュレーションを通じて、行動コーディングや標準的なフォワードトレーニングに比べて本手法の優位性を検証すること。

提案手法

  • 長時間スパンと制約付き線形系を扱えるように、ポリシー勾配に基づくオンポリシーの模倣学習手法であるフォワードトレーニングアルゴリズムをMPC応用に適応させる。
  • MPCが定常線形系においてLQRに収束することを活用し、データから推定された時間区間後にMPCからLQRに切り替えるスイッチング機構を導入する。
  • 模倣プロセスのロバスト性を向上させ、分布シフトへの感受性を低減するために、ロバストMPCをエキスパートポリシーとして採用する。
  • MPCコントローラーとシステムをフィードバックで連携させることで、オンラインの軌道を収集し、トレーニング分布と実稼働分布を一致させる。
  • 高次元統計と統計学習理論を用いて、MPC軌道の必要数を理論的に境界付け、最適性能への収束を保証する。
  • LQR下で正の不変集合に到達する時間区間 $"]\hat{\tau}_{\infty}"]$ を推定し、安全なスイッチングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1MPCポリシーを学習する際、行動コーディングと比較してオンポリシーの模倣学習は、分布シフトと誤差の累積をどのように軽減できるか?
  • RQ2線形系を安定化させ、制約を満たすコントローラーを模倣学習によって学習するために必要な理論的サンプル複雑度は何か?
  • RQ3フォワードトレーニングアルゴリズムは、状態および入力制約を伴う長時間スパンのMPC問題をどのように扱えるように適応できるか?
  • RQ4データから推定された時間区間後にLQRに切り替えることで、MPCベースの模倣学習におけるサンプル効率性と性能は向上するか?
  • RQ5学習済みコントローラーは、高い確率でMPCに近いコストサブオプティマル性を達成できるか?そのサブオプティマル性の理論的境界は何か?

主な発見

  • d=5のシステムにおいて、Forward-Switchは180回のMPCデモンストレーションでのみ平均正規化コストto-goが約1.034に達し、標準的なフォワードトレーニングを著しく上回った。
  • 210回のデモンストレーションを用いた標準的なフォワードトレーニングでは、平均正規化コストto-goが約35に達し、分布シフトによる深刻な性能劣化が示された。
  • 本手法により、コストサブオプティマル性が最適性能の3.4%以内にまで低減され、限られたデータでもほぼ最適制御が達成された。
  • 同じ12ステップのホライズンを用いても、Forward-Switchは行動コーディングの対応手法を上回り、より優れたサンプル効率性とロバスト性を示した。
  • 理論的分析により、サンプル複雑度の境界と安定性・制約満足に関する保証が得られ、これらは先行するMPCベースの模倣学習手法には欠けていた。
  • d=5のシステムにおける推定時間区間 $"]\hat{\tau}_{\infty} = 12"]$ は、LQRへの安全なスイッチングを保証するのに十分であり、スイッチング戦略の実用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。