Skip to main content
QUICK REVIEW

[論文レビュー] Structured Neural Network Dynamics for Model-based Control

Alexander Broad, Ian Abraham|arXiv (Cornell University)|Aug 3, 2018
Model Reduction and Neural Networks参考文献 16被引用数 7
ひとこと要約

この論文では、時間変動線形系としてのシステムダイナミクスを明示的にモデル化する構造化ニューラルネットワークアーキテクチャを提案する。勾配ベースのモデル予測制御(MPC)と効率的に統合可能であり、オンラインでの導出計算が不要なため、時間変動ジャコビアン(AおよびB行列)を直接出力することで実現される。この手法により、最適制御合成のための高速で微分可能な線形化を可能にするグローバルダイナミクスモデルを学習し、連続的制御環境で効果的な制御を達成する。

ABSTRACT

We present a structured neural network architecture that is inspired by linear time-varying dynamical systems. The network is designed to mimic the properties of linear dynamical systems which makes analysis and control simple. The architecture facilitates the integration of learned system models with gradient-based model predictive control algorithms, and removes the requirement of computing potentially costly derivatives online. We demonstrate the efficacy of this modeling technique in computing autonomous control policies through evaluation in a variety of standard continuous control domains.

研究の動機と目的

  • ブラックボックスなニューラルネットワークダイナミクスモデルと勾配ベース最適制御アルゴリズムを統合する課題に取り組むこと。通常、これには計算コストの高いオンライン導出計算が必要となる。
  • 状態空間および制御空間において線形構造を強制するニューラルネットワークアーキテクチャを開発すること。これにより、モデル予測制御における時間変動ジャコビアン(AおよびB)の回復が簡素化される。
  • ディープネットワークの表現力と時間変動線形系の解析的取り扱いやすさを組み合わせることで、データ効率的かつスケーラブルなモデルベース制御を実現すること。
  • サンプリングベース最適化に依存せずに、多様な連続的制御タスクにおいて成功する自律制御ポリシーを生成できることを示すこと。

提案手法

  • アーキテクチャは2つの並列サブネットワークで構成される:状態空間へのマッピングを出力するAサブネット、制御空間へのマッピングを出力するBサブネット。両者はそれぞれ状態ベクトルおよび制御ベクトルの次元に一致するように制約を課す。
  • ネットワークは $ \dot{x} = A(x,u) \cdot x + B(x,u) \cdot u $ としてシステムダイナミクスを計算する。ここで $ A $ および $ B $ は、バックプロパゲーションにより学習される非線形関数である。
  • AサブネットおよびBサブネットは、状態-制御-微分値の三つ組データセット上で、予測された状態微分と真の状態微分の平均二乗誤差を最小化することで、真のシステムダイナミクスを近似するように訓練される。
  • 学習された $ A $ および $ B $ サブネットワークは、勾配ベースMPCに必要な時間変動ジャコビアンを直接提供する。これにより、推論時における数値的または自動微分の必要性が排除される。
  • この手法は、有限時間ホライズン上でコスト関数を最小化する最適制御問題を解くモデル予測制御フレームワークに統合される。予測ダイナミクスとジャコビアンを用いて、効率的な軌道最適化が実現される。
  • モデルはAdam最適化アルゴリズムを用いて訓練され、学習率は 0.001 である。データ前処理は不要である。

実験結果

リサーチクエスチョン

  • RQ1勾配ベース最適制御に使用するため、時間変動システムジャコビアン(AおよびB行列)を明示的に符号化するニューラルネットワークアーキテクチャを設計可能か?
  • RQ2時間変動線形系を模倣する構造化ダイナミクスモデルを学習することで、連続的制御タスクにおけるモデルベース制御の効率性と正確性が向上するか?
  • RQ3有限差分や自動微分といった代替的導出手法と比較して、計算コストおよび数値的安定性の観点で、本手法はどのように差をつけるか?
  • RQ4構造化ニューラルネットワークは、多様な初期条件および任意のゴール状態から成功する制御を可能にするグローバルダイナミクスモデルを学習できるか?

主な発見

  • 提案された構造化ニューラルネットワークは、2リンクアームを含む複数の標準的な連続的制御環境で、さまざまな初期条件から任意のゴール状態に到達する軌道を生成する自律制御ポリシーを成功裏に生成した。
  • オンラインでの導出計算が不要なため、時間変動ジャコビアン(AおよびB)を直接出力することで、勾配ベースMPCとの効率的統合が実現され、計算コストが低減された。
  • サンプリングベース最適化に依存せず、学習済みで微分可能なダイナミクスモデルをリアルタイム制御ループに適用可能であることを示した。
  • 実験的に、AおよびBサブネットワークの出力が真の勾配の方向と整合していることが示された。MPCに使用した際の成功したポリシー生成がその証左である。
  • 本手法は、異なる初期条件に対してロバストであり、2リンクアーム環境においても新たなゴール状態に一般化可能である。これは、学習済みダイナミクスモデルの優れた一般化性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。