Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian model predictive control: Efficient model exploration and regret bounds using posterior sampling

Kim P. Wabersich, Melanie N. Zeilinger|arXiv (Cornell University)|May 24, 2020
Advanced Control Systems Optimization参考文献 24被引用数 9
ひとこと要約

この論文は、未知のシステムダイナミクスと目的関数における探索と活用のバランスをとるために、事後分布からのサンプリングを用いるベイジアンモデル予測制御(MPC)フレームワークを提案する。各エピソードの開始時に最適制御則の事後分布からMPC制御則をサンプリングすることで、計算効率を保ちながら有限時間のレグレットバウンドを達成する。ノイズのあるフィードバックを伴う非線形なカー・トレーラー系において実証された。

ABSTRACT

Tight performance specifications in combination with operational constraints make model predictive control (MPC) the method of choice in various industries. As the performance of an MPC controller depends on a sufficiently accurate objective and prediction model of the process, a significant effort in the MPC design procedure is dedicated to modeling and identification. Driven by the increasing amount of available system data and advances in the field of machine learning, data-driven MPC techniques have been developed to facilitate the MPC controller design. While these methods are able to leverage available data, they typically do not provide principled mechanisms to automatically trade off exploitation of available data and exploration to improve and update the objective and prediction model. To this end, we present a learning-based MPC formulation using posterior sampling techniques, which provides finite-time regret bounds on the learning performance while being simple to implement using off-the-shelf MPC software and algorithms. The performance analysis of the method is based on posterior sampling theory and its practical efficiency is illustrated using a numerical example of a highly nonlinear dynamical car-trailer system.

研究の動機と目的

  • システムのダイナミクスと目的関数が不確実な状況におけるデータ駆動型MPCにおける探索と活用のバランスをとる課題に対処すること。
  • 複雑な確率的動的プログラミングを必要とせず、データ活用と有益なデータ収集の自動的トレードオフを実現する学習ベースのMPC制御則を開発すること。
  • 不確実性下での学習ベースMPCに対して、有限時間のレグレットバウンドという理論的性能保証を提供すること。
  • 事後分布サンプリング技術を活用することで、標準的なMPCソフトウェアを直接使用できる実用的実装を可能にすること。

提案手法

  • 各エピソードの開始時に、現在のシステムダイナミクスと目的関数に関する信念に基づき、最適制御則の事後分布からMPC制御則をサンプリングする。
  • 不確実なシステムパラメータをモデル化するためにベイジアン線形回帰を用い、環境からのノイズのある測定値を用いて信念を更新する。
  • 制約違反に耐性を持つように、スラック変数を含むコスト関数とソフト制約を用いた制御則設計により、学習中のロバストネスを確保する。
  • レグレットは、エピソード全体にわたる最適制御則の性能とサンプリングされた制御則の性能の累積差として定義される。
  • モデルパラメータの不確実性に起因する探索を保証するために、トムソン・サブミッションの原則をMPCに統合する。
  • 1エピソードあたり1回のMPCソルブのみを用いることで、標準MPCと同等の計算複雑性を維持し、反復的または近似動的プログラミングを回避する。

実験結果

リサーチクエスチョン

  • RQ1状態および入力制約を伴う未知の力学的システムにおける学習ベースMPCにおいて、探索と活用を効果的にバランスさせることは可能か?
  • RQ2MPCにおける事後分布サンプリングは、非線形システムに対しても理論的レグレットバウンドを提供しつつ、計算的に実行可能か?
  • RQ3プロセスノイズおよび測定ノイズは、提案されたベイジアンMPCフレームワークの学習性能にどのような影響を及えるか?
  • RQ4高次非線形系において、不確実なダイナミクスと目的関数を伴う状況で、この手法は実際の性能をどのように発揮するか?
  • RQ5レグレットバウンドは、モデルの不確実性およびシステムの正則性に比例して導出可能であり、形式的に示せるか?

主な発見

  • 提案されたベイジアンMPC手法は、プロセスノイズおよび測定ノイズ、および期待されるコスト・トゥ・ゴ関数の正則性に比例する有限時間のレグレットバウンドを達成する。
  • 数値例では、最初の15回の学習エピソード以内に中央値のレグレットが急速に低下し、近似的に最適な制御性能に収束することが示された。
  • コスト関数内のスラック変数を通じて、累積期待制約違反が統合されたパフォーマンス指標として組み込まれており、一貫性のある評価が可能である。
  • 6状態、2入力、不確実パラメータを有する高次非線形なカー・トレーラー系において、250回の学習エピソードで実用的効率が実証された。
  • 理論的結果は、各エピソードにおける有界な状態と目的関数のもとで成り立つが、MPCの内在的な制約満たし特性により、実用的に保証される。
  • 標準MPCソルバーを直接使用できるため、カスタムまたは計算コストの高いアルゴリズムの必要がなくなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。