Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Decomposition of Nonlinear Dynamics and Control for System Identification and Policy Distillation

Hany Abdulsamad, Jan Peters|arXiv (Cornell University)|May 4, 2020
Control Systems and Identification参考文献 49被引用数 6
ひとこと要約

本稿では、期待最大化(EM)アルゴリズムを用いた確率的スイッチング線形動的システム(SLS)を用いて、非線形ダイナミクスおよび制御の階層的分解フレームワークを提案する。複雑なシステムを局所的に線形でマルコフ的な制御器の混合としてモデル化することで、解釈可能なシステム同定とポリシー蒸留が可能となり、深層ニューラルネットワークと比較して大幅に簡素化されたポリシー複雑度で、スイングアップおよび安定化タスクにおいて95%以上の成功を達成する。

ABSTRACT

The control of nonlinear dynamical systems remains a major challenge for autonomous agents. Current trends in reinforcement learning (RL) focus on complex representations of dynamics and policies, which have yielded impressive results in solving a variety of hard control tasks. However, this new sophistication and extremely over-parameterized models have come with the cost of an overall reduction in our ability to interpret the resulting policies. In this paper, we take inspiration from the control community and apply the principles of hybrid switching systems in order to break down complex dynamics into simpler components. We exploit the rich representational power of probabilistic graphical models and derive an expectation-maximization (EM) algorithm for learning a sequence model to capture the temporal structure of the data and automatically decompose nonlinear dynamics into stochastic switching linear dynamical systems. Moreover, we show how this framework of switching models enables extracting hierarchies of Markovian and auto-regressive locally linear controllers from nonlinear experts in an imitation learning scenario.

研究の動機と目的

  • 現代の深層強化学習ポリシーにおける解釈不能性の問題に対処するため、複雑な非線形ダイナミクスをより単純な局所線形成分に分解すること。
  • 確率的グラフィカルモデルを用いて、示範データからハイブリッドダイナミクスおよび制御ポリシーをデータ駆動で同定する手法を開発すること。
  • 深層RLエージェントのような過パラメータ化されたエキスパートから、コンactで自己回帰的で局所的に線形な制御器を抽出することで、ポリシー蒸留を実現すること。
  • 局所的に線形なモデルが、限られたデータでも長時間スケールの非線形ダイナミクスを効果的に捉えることができるかどうかを示すこと。
  • 模倣学習を可能にするために、フレームワークを内生的入力(endogenous inputs)をサポートするように拡張し、複雑なポリシーを解釈可能なスイッチング制御器に圧縮すること。

提案手法

  • フレームワークは、離散的スイッチング状態を有する、再帰的自己回帰的隠れマルコフモデル(rAR-HMM)として非線形ダイナミクスをモデル化する。これは、ハイブリッド動的ベイジアンネットワーク(HDBN)の一種である。
  • スイッチング線形動的システムのパラメータ(遷移確率、状態ダイナミクス、観測モデル)を同時に推定するための期待最大化(EM)アルゴリズムを導出する。
  • ポリシーネットワークからの内生的入力を組み込むことで、オープンループのシステム同定とクローズドループの制御学習の両方を可能にする。
  • メッセージパッシングと変分推論を用いて、潜在的な離散状態を扱い、時系列データからのスイッチング構造の効率的学習を可能にする。
  • マルコフ的および自己回帰的局所線形制御器の両方をサポートすることで、階層的ポリシー表現を実現する。
  • rAR-HMMをエキスパートの示範を模倣するように訓練することで、コンactで解釈可能なハイブリッドポリシーを生成し、ポリシー蒸留を達成する。

実験結果

リサーチクエスチョン

  • RQ1スイッチングダイナミクスを有する確率的グラフィカルモデルは、限られた時系列データから複雑な非線形ダイナミクスを効果的に同定できるか?
  • RQ2非線形制御ポリシーを局所線形制御器に階層的に分解することで、タスクの性能を維持しつつモデルの複雑度を低減できるか?
  • RQ3rAR-HMMフレームワークにおける内生的入力は、エキスパートポリシーからの模倣学習をどの程度効果的に可能にするか?
  • RQ4提案されたEMベースの推論手法は、事前知識なしに意味のあるスイッチング領域を自動で発見できるか?
  • RQ5ハイブリッドフレームワークにおける局所線形制御器の使用は、古典的制御ベンチマークで深層ニューラルネットワークポリシーと同等またはそれ以上の性能を達成できるか?

主な発見

  • rAR-HMMフレームワークは、蒸留されたハイブリッドポリシーを用いて、パーカッションとカートポールの両環境でスイングアップおよび安定化タスクにおいて95%以上の成功率を達成した。
  • この手法は、非線形ダイナミクスを解釈可能な局所線形成分に効果的に分解し、自己回帰的構造によって長時間スケールの依存関係を捉えていた。
  • ポリシー蒸留により、SACエージェントの4,545パラメータから、5つのスイッチング領域と50パラメータのハイブリッドポリシーにまで削減され、同等の性能が達成された。
  • EMアルゴリズムは、スイッチング構造とダイナミクスパラメータを効果的に学習し、限られたデータでも正確なシステム同定を可能にした。
  • フレームワークは、局所線形制御器が古典的制御タスクにおける複雑な非線形行動を効果的に表現できることを示した。
  • 内生的入力の導入により、示範データからエキスパートの行動を回復できる模倣学習が効果的に実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。