Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning of Koopman Representation for Control

Yiqiang Han, Wenjian Hao|arXiv (Cornell University)|Oct 15, 2020
Model Reduction and Neural Networks参考文献 25被引用数 5
ひとこと要約

本稿では、非線形制御系を線形で無限次元空間に持ち上げるための最適な基底関数を学習するために深層ニューラルネットワーク(DNN)を用いる、データ駆動型でモデルフリーなフレームワーク、Deep Koopman Representation for Control(DKRC)を提案する。この手法により、DNNで学習したKoopman表現を用いた効率的なモデル予測制御(MPC)が可能となり、OpenAI Gymの環境(スイングアップペンドulumやLunar Landerなど)において、DDPG強化学習よりも訓練効率と制御性能に優れる。

ABSTRACT

We develop a data-driven, model-free approach for the optimal control of the dynamical system. The proposed approach relies on the Deep Neural Network (DNN) based learning of Koopman operator for the purpose of control. In particular, DNN is employed for the data-driven identification of basis function used in the linear lifting of nonlinear control system dynamics. The controller synthesis is purely data-driven and does not rely on a priori domain knowledge. The OpenAI Gym environment, employed for Reinforcement Learning-based control design, is used for data generation and learning of Koopman operator in control setting. The method is applied to two classic dynamical systems on OpenAI Gym environment to demonstrate the capability.

研究の動機と目的

  • 非線形系制御における事前分野知識や手作業で設計された基底関数の必要性を回避する、データ駆動型でモデルフリーな制御フレームワークの開発。
  • 自律系に限られる深層学習ベースのKoopman作用素同定を、入力制御を伴う制御可能な力学系へと拡張すること。
  • DNNを用いて適切な高次元基底関数を学習することで、リフトド空間において線形制御技術(LQR や MPC)を適用可能にする。
  • OpenAI Gymのベンチマーク制御環境(ペンドulumやLunar Landerを含む)において、提案手法の有効性を実証すること。
  • データ駆動型Koopman表現を活用することで、モデルベース制御とモデルフリー強化学習のギャップを埋めること。

提案手法

  • 本手法は、OpenAI Gym環境からの時系列データを用いて、非線形状態空間の有限次元・高次元リフトをDNNで学習する。
  • リフトド空間においてKoopman作用素は線形モデルで近似される:Ψ(x_{t+1}) = AΨ(x_t) + Bu_t、ここでΨ(x)はDNNで学習された基底関数を表す。
  • 多項式や径路基底関数などの事前定義関数に依存せず、データからエンドツーエンドで基底関数を学習する。
  • 十分な探索を確保するため、オーランシュタイン=ウーレンバックノイズを伴うランダムポリシーによって生成されたデータを用いてKoopman表現を訓練する。
  • 制御合成のために、同定された線形ダイナミクスを用いてリフトド空間でモデル予測制御(MPC)を適用する。
  • 本フレームワークは、2つのOpenAI Gym環境(ペンドulumのスイングアップタスクとLunar Landerの制御タスク)で評価された。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、事前分野知識を必要とせずに、非線形力学系の線形制御を可能にするKoopman基底表現を効果的に学習できるか?
  • RQ2DNNで学習したKoopman表現の性能は、最先端の強化学習(例:DDPG)と比較して、訓練効率および制御精度の面で優れているか?
  • RQ3本手法は、異なる初期条件に一般化可能であり、Lunar Landerのような複雑な環境における摂動に対しても耐性を示せるか?
  • RQ4学習されたKoopman表現は、システムのエネルギー動的をどの程度正確に保持し、目標状態への高速収束を可能にするか?
  • RQ5完全にデータ駆動型のKoopman学習フレームワークを用いて、モデルベース制御の性能を達成できるか?

主な発見

  • DKRCフレームワークは、Lunar Lander環境で5ゲームにわたって収集された1876組のデータペアからKoopman表現を成功裏に学習し、真のシステムモデルにアクセスできない状況下でも効果的な制御を可能にした。
  • ペンドulum制御タスクでは、DKRCコントローラーが迅速にシステムエネルギーを最小化し、短時間で目標状態(θ=0, ˙θ=0)に到達した。これは、ハミルトニアンエネルギー等高線を効率的に横断する軌道によって裏付けられた。
  • DKRCモデルは、10回の異なるゲームランで一貫した収束を示し、ペンドulumおよびLunar Lander環境の両方において、ランダムな初期条件に対してもロバストであることが確認された。
  • DKRCモデルは、エネルギー最小化および収束速度の面で、DDPG強化学習ベースラインよりも高速な訓練と優れた制御性能を達成した。
  • ハミルトニアンエネルギー等高線でカラー化された3次元の状態-時間軌道は、DKRCがシステムエネルギーを効果的に低減していることを示しており、最適制御行動を示している。
  • 本手法は、リフトド空間においてMPCを効果的に適用し、Koopmanに基づく線形モデルが非線形系において古典的線形制御技術の適用を可能にしていることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。