Skip to main content
QUICK REVIEW

[論文レビュー] Data Driven Control with Learned Dynamics: Model-Based versus Model-Free Approach

Wenjian Hao, Yiqiang Han|arXiv (Cornell University)|Jun 16, 2020
Model Reduction and Neural Networks参考文献 26被引用数 7
ひとこと要約

この論文は、ニューラルネットワークを用いて挙上空間における線形化されたダイナミクスモデルを学習する、モデルベースのデータ駆動制御手法である Deep Koopman Representation for Control (DKRC) と、モデルフリーなアプローチである Deep Deterministic Policy Gradient (DDPG) を比較している。DKRC は、50,000 エポックと比較してわずか 70 エポックで同等の制御性能を達成し、より少ないサンプル数で学習可能であり、物理的制約を組み込んだモデル構造のおかげで解釈可能性とロバスト性に優れている。この有効性は、解析的オイラー=ラグランジュ線形化との相関係数 0.8926 によって検証された。

ABSTRACT

This paper compares two different types of data-driven control methods, representing model-based and model-free approaches. One is a recently proposed method - Deep Koopman Representation for Control (DKRC), which utilizes a deep neural network to map an unknown nonlinear dynamical system to a high-dimensional linear system, which allows for employing state-of-the-art control strategy. The other one is a classic model-free control method based on an actor-critic architecture - Deep Deterministic Policy Gradient (DDPG), which has been proved to be effective in various dynamical systems. The comparison is carried out in OpenAI Gym, which provides multiple control environments for benchmark purposes. Two examples are provided for comparison, i.e., classic Inverted Pendulum and Lunar Lander Continuous Control. From the results of the experiments, we compare these two methods in terms of control strategies and the effectiveness under various initialization conditions. We also examine the learned dynamic model from DKRC with the analytical model derived from the Euler-Lagrange Linearization method, which demonstrates the accuracy in the learned model for unknown dynamics from a data-driven sample-efficient approach.

研究の動機と目的

  • 非線形制御タスクにおけるモデルベースのデータ駆動制御(DKRC)とモデルフリーの強化学習(DDPG)を比較すること。
  • さまざまな初期化条件における DKRC と DDPG のサンプル効率とロバスト性を評価すること。
  • オイラー=ラグランジュ線形化から導出された解析的モデルと比較することで、DKRC が学習したダイナミクスの正確さを検証すること。
  • DKRC が学習した挙上線形システムに適用した MPC の性能を、モデル不確実性下でも評価すること。
  • データ駆動型コプマン表現が、システム方程式の事前知識なしに高精度なシステムモデリングを達成できることを示すこと。

提案手法

  • 非線形システムを高次元の線形空間に挙上する有限次元のコプマン表現を学習するための深層ニューラルネットワークを用い、Model Predictive Control (MPC) を用いた線形制御を可能にする。
  • コプマンダイナミクスの離散化にゼロオーダーホールド(ZOH)法を適用し、挙上システムモデルの数値的実装を可能にする。
  • 凸最適化問題を CVXPY を用いて解き、挙上システムの線形構造を活かしてリアルタイムでロバストな制御を実現する。
  • Inverted Pendulum 環境からの 2,000 点のデータのみを用いて、DKRC フレームワークを訓練し、コプマン作用素の近似を学習する。
  • 同じ環境と連続的アクション空間でエンドツーエンドに訓練されるモデルフリーなベースラインとして、Deep Deterministic Policy Gradient (DDPG) アルゴリズムを用いる。
  • Pearson相関係数(PCC)を用いて、DKRC が学習したダイナミクスと、オイラー=ラグランジュ法による解析的線形化との類似度を測定する。

実験結果

リサーチクエスチョン

  • RQ1DKRC は、非線形力学的システムに対する効果的な制御方策を学習する際、DDPG よりもどれほどサンプル効率が優れているか?
  • RQ2DKRC が学習したコプマン表現は、オイラー=ラグランジュ方程式から導出された解析的線形化ダイナミクスとどの程度一致するか?
  • RQ3初期条件が異なる状況下で、モデルベースの DKRC はモデルフリーの DDPG よりもどの程度優れた性能を示すか?
  • RQ4DKRC が学習した挙上線形システムに MPC を適用した場合、モデル誤差が存在してもロバストな制御性能を達成できるか?
  • RQ5物理的制約を組み込んだモデルベース手法(DKRC)と、完全にデータ駆動型のポリシー勾配法(DDPG)を比較した場合、解釈可能性と性能のトレードオフはどのようなものか?

主な発見

  • DKRC は、Inverted Pendulum タスクと Lunar Lander タスクにおいて DDPG と同等の制御性能を達成したが、学習に要したエポック数は 70 にとどまり、DDPG の 50,000 エポックと比べて著しく少ない。
  • DKRC が学習したダイナミクスは、解析的オイラー=ラグランジュ線形化と高いピアソン相関係数 0.8926 を示し、真のシステムダイナミクスに強く一致していることが確認された。
  • DKRC は、オイラー=ラグランジュ MPC 法に比べて、真上位置への収束に要する時間を約 20% にまで短縮した。これは、収束速度の優位性を示している。
  • 初期条件の変動に対して、モデルベースの DKRC フレームワークは DDPG よりもより高いロバスト性を示した。特に、大きな初期偏差の処理において顕著であった。
  • DKRC が学習した線形モデルに適用した MPC コントローラーは、小さなモデル誤差に対しても耐性を示し、モデルベース学習における閉ループ制御の利点を裏付けた。
  • データ駆動型コプマン表現は、2,000 点のデータのみを用いても、システムの本質的ダイナミクスを的確に捉えることができ、サンプル効率の高さと実世界への適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。