Skip to main content
QUICK REVIEW

[論文レビュー] Combining Model-Based and Model-Free Methods for Nonlinear Control: A Provably Convergent Policy Gradient Approach

Guannan Qu, Chenkai Yu|arXiv (Cornell University)|Jun 12, 2020
Iterative Learning Control Systems参考文献 49被引用数 11
ひとこと要約

本稿では、非線形システムにおけるモデルベースとモデルフリー手法を組み合わせるハイブリッド制御フレームワークを提案する。線形モデルベース制御器をモデルフリーのポリシー勾配法のウォームスタートとして用いることで、非線形部にやや厳しい条件が課せられるが、ほぼグローバルに最適な制御器への収束を保証する。この手法は、モデルベース制御のサンプル効率とモデルフリー学習の柔軟性を統合する。

ABSTRACT

Model-free learning-based control methods have seen great success recently. However, such methods typically suffer from poor sample complexity and limited convergence guarantees. This is in sharp contrast to classical model-based control, which has a rich theory but typically requires strong modeling assumptions. In this paper, we combine the two approaches to achieve the best of both worlds. We consider a dynamical system with both linear and non-linear components and develop a novel approach to use the linear model to define a warm start for a model-free, policy gradient method. We show this hybrid approach outperforms the model-based controller while avoiding the convergence issues associated with model-free approaches via both numerical experiments and theoretical analyses, in which we derive sufficient conditions on the non-linear component such that our approach is guaranteed to converge to the (nearly) global optimal controller.

研究の動機と目的

  • モデルフリー制御の限界、特に非線形システムにおけるサンプル複雑性の低さと収束保証の欠如を是正すること。
  • 強いパrametric仮定に依存し、モデルが不正確な場合に失敗するモデルベース制御の欠点を克服すること。
  • 非線形制御においてモデルベースとモデルフリー手法を理論的に統合し、サンプル効率と収束保証の両方を達成すること。
  • ハイブリッドポリシー勾配法がほぼグローバルに最適な制御器に収束する十分条件を確立すること。

提案手法

  • システムは、線形部(モデルベース制御に適した)と非パrametricな非線形部の和としてモデル化される。
  • システムの線形部を用いて、まずモデルベースの状態フィードバック制御器が設計され、ポリシー勾配法のウォームスタートとして機能する。
  • その後、ポリシー勾配法が、モデルベース制御器から初期化された完全な非線形システムに適用される。
  • 理論的分析により、モデルベース制御器が、グローバル最小値を含む凸領域内に位置することが示される。
  • 勾配推定には、制御ゲイン行列に確率的摂動を加えたゼロ次近似の確率的近似法が用いられる。
  • 勾配のリップシッツ連続性とコスト関数の有界性の下で、ハイーディングの不等式を用いて高確率で収束が保証される。

実験結果

リサーチクエスチョン

  • RQ1モデルベースとモデルフリー手法を組み合わせることで、非線形制御においてサンプル効率と収束保証の両方を達成できるか?
  • RQ2非線形部にどのような条件下で、ハイブリッドポリシー勾配法がほぼグローバルに最適な制御器に収束するか?
  • RQ3モデルベース制御器からのウォームスタートが収束に不可欠であるのか、それともモデルフリー手法は事前のモデル情報なしに収束可能か?
  • RQ4非線形システムの状態フィードバック制御器空間におけるコスト関数の形状は、どのように振る舞うか?

主な発見

  • モデルベース制御器は、グローバル最小値(またはほぼグローバル最小値)を含む凸領域に位置しており、ウォームスタートとして用いることで収束が保証される。
  • 数値実験において、純粋なモデルベース制御より優れた性能を示し、純粋なモデルフリー手法の収束問題を回避する。
  • 軌道の減衰性とコストの有界性に関する仮定の下で、Hoeffdingの不等式を用いて勾配推定誤差が高確率で有界であることが示される。
  • 非線形部に、有界性と勾配のリップシッツ連続性が課せられる十分条件が、ほぼグローバルに最適な制御器への収束を保証する。
  • 軌道数と摂動数に対する明示的なサンプル複雑性の上限がある条件下で、高確率での収束が達成される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。