Skip to main content
QUICK REVIEW

[論文レビュー] Neural Hybrid Automata: Learning Dynamics with Multiple Modes and Stochastic Transitions

Michael Poli, Stefano Massaroli|arXiv (Cornell University)|Jun 8, 2021
Reinforcement Learning in Robotics参考文献 44被引用数 7
ひとこと要約

本論文は、未知のモード数と確率的遷移を有する確率的ハイブリッドシステムをデータ駆動で学習するためのフレームワーク、Neural Hybrid Automata (NHA) を提案する。ニューラル微分方程式、ノーマライジングフロー、自己教師学習を組み合わせることで、システム構造の事前知識がなくてもマルチモードのダイナミクスとイベント駆動型遷移を推論でき、ロボットスワームにおける正確なモード回復とエンドツーエンド制御を達成し、99.8%のターゲット精度を達成した。

ABSTRACT

Effective control and prediction of dynamical systems often require appropriate handling of continuous-time and discrete, event-triggered processes. Stochastic hybrid systems (SHSs), common across engineering domains, provide a formalism for dynamical systems subject to discrete, possibly stochastic, state jumps and multi-modal continuous-time flows. Despite the versatility and importance of SHSs across applications, a general procedure for the explicit learning of both discrete events and multi-mode continuous dynamics remains an open problem. This work introduces Neural Hybrid Automata (NHAs), a recipe for learning SHS dynamics without a priori knowledge on the number of modes and inter-modal transition dynamics. NHAs provide a systematic inference method based on normalizing flows, neural differential equations and self-supervision. We showcase NHAs on several tasks, including mode recovery and flow learning in systems with stochastic transitions, and end-to-end learning of hierarchical robot controllers.

研究の動機と目的

  • システムのモード数や遷移ダイナミクスの事前知識がなくても、データから確率的ハイブリッドシステム(SHS)を学習する汎用的手法を開発すること。
  • 特に確率的かつマルチモーダルな状況下において、ハイブリッドシステム学習における連続的流れと離散的イベントの混合問題に取り組むこと。
  • デモレーションデータから計画と制御ポリシーを同時に学習することで、階層的ロボットコントローラーのエンドツーエンド訓練を可能にすること。
  • SHSモデリングにニューラルODE、ノーマライジングフロー、自己教師学習を統合する体系的な推論フレームワークを提供すること。

提案手法

  • NHAs は、3つのコアコンponentsでSHSをモデル化する:モード固有の連続的ダイナミクスを記述するニューラル微分方程式(NDE)、システムモードを追跡する離散的潜在状態、確率的遷移タイミングを予測するイベントモジュール。
  • イベントモジュールは、パラメトリックなTPP(時系列点過程)から導出された強度関数を用い、確率的遷移は逆変換サンプリングと指数分布変数によってモデル化される。
  • ノーマライジングフローを用いて潜在状態の分布をモデル化し、モード遷移とシステム進化に関する微分可能な推論を可能にする。
  • 自己教師学習は、ロボットの位置とリソースマップに基づいてターゲットを選択するポリシー・プランナを介して適用され、制御ポリシーのエンドツーエンド訓練を可能にする。
  • データセット生成には、適応的ステップサイズとルートファインディングを備えたハイブリッドODE統合アルゴリズムが用いられ、複数のイベントタイプとモード遷移をサポートする。
  • 強度関数をイベント検出メカニズムに埋め込むことで、決定的および確率的イベント処理の両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1ニューラルアーキテクチャは、モード数の事前知識がなくても、ハイブリッドシステムにおけるマルチモード連続的ダイナミクスと確率的遷移を学習できるか?
  • RQ2NHAs は、観測された軌道から隠れたシステムモードをどれほど正確に回復でき、その背後にあるダイナミクスをどれほど正確に再構築できるか?
  • RQ3NHAs は、複雑で動的な環境下で、階層的ロボットコントローラーのエンドツーエンド学習をどの程度可能にするか?
  • RQ4NHAs は、未確認のマップレイアウトに一般化し、ロボットスワームタスクにおける高い制御精度を維持できるか?

主な発見

  • NHAs は、モード数が未知であっても、確率的遷移を伴うシステムで、システムモードを正常に回復し、マルチモード連続的ダイナミクスを学習した。
  • ロボットスワーム制御タスクにおいて、100台のロボットを用いた既知のマップレイアウトで、平均99.8% ± 0.8%のターゲット精度を達成した。
  • 新しい未確認のマップレイアウトにおいても、モデルは効果的に一般化し、100台のロボットで平均98.5% ± 1.95%のターゲット精度を達成した。
  • 学習プロセスは4000エピソードで収束し、平均報酬と制御損失の両方が安定化しており、学習の強固さが示された。
  • 適応的ステッピングとルートファインディングを備えたハイブリッド統合アルゴリズムにより、複雑なイベントシーケンスとモードスイッチの正確なシミュレーションが可能になった。
  • 階層的制御において、プランナと低レベルコントローラーが自己教師学習を介して同時に訓練されたことで、強力な一般化性能が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。