Skip to main content
QUICK REVIEW

[論文レビュー] Lyapunov-Based Reinforcement Learning State Estimator

Liang Hu, Chengwei Wu|arXiv (Cornell University)|Oct 26, 2020
Adaptive Dynamic Programming Control参考文献 41被引用数 11
ひとこと要約

本稿では、非線形離散時系列確率的システムに対して、シミュレーションデータから学習する深層ニューラルネットワークを用いてフィルタゲインを学習する、リャプノフに基づく深層強化学習状態推定器(LRLF)を提案する。理論的に初期誤差やノイズの仮定に依存せずに推定誤差が有界であることを保証し、ノイズ分散の変化や測定値の欠落といった不確実性下でも、従来のフィルタを上回る性能を示す。

ABSTRACT

In this paper, we consider the state estimation problem for nonlinear stochastic discrete-time systems. We combine Lyapunov's method in control theory and deep reinforcement learning to design the state estimator. We theoretically prove the convergence of the bounded estimate error solely using the data simulated from the model. An actor-critic reinforcement learning algorithm is proposed to learn the state estimator approximated by a deep neural network. The convergence of the algorithm is analysed. The proposed Lyapunov-based reinforcement learning state estimator is compared with a number of existing nonlinear filtering methods through Monte Carlo simulations, showing its advantage in terms of estimate convergence even under some system uncertainties such as covariance shift in system noise and randomly missing measurements. To the best of our knowledge, this is the first reinforcement learning based nonlinear state estimator with bounded estimate error performance guarantee.

研究の動機と目的

  • 離散時系列確率的システムに対して、証明可能な有界推定誤差を有する非線形状態推定器を設計すること。
  • EKF や UKF で一般的な、初期誤差が小さいことや線形化誤差が無視できるという制限付き仮定に依存しないこと。
  • リアルタイムのオンライン計算を要しない、シミュレーションデータから学習する深層強化学習フレームワークを構築すること。
  • モデルフリー強化学習の文脈において、リャプノフに基づく解析を用いて推定誤差の理論的安定性と収束性を保証すること。
  • ノイズ分散の変化や測定値の欠落といったシステムの不確実性下でも、状態推定の性能保証を提供すること。

提案手法

  • フィルタゲインは、システムモデルからのシミュレーションデータのみを用いてトレーニングされたアクタ・クリティック強化学習アルゴリズムにより、深層ニューラルネットワーク(DNN)で近似される。
  • リャプノフの直接法を適用して推定誤差ダイナミクスの安定性を証明し、初期誤差やノイズレベルに関する仮定なしに推定誤差が有界であることを保証する。
  • トレーニングの目的関数は、推定誤差を状態とし、フィルタゲインの更新を行動とするマルコフ決定過程として定式化される。
  • アルゴリズムは、価値関数を推定するクリティックネットワークと、フィルタゲインを出力するアクタネットワークを用い、両者とも期待推定誤差を最小化するようにトレーニングされる。
  • リャプノフ安定性フレームワークの下で、強化学習アルゴリズムの理論的収束性が確立され、推定プロセスにおける誤差が有界であることが保証される。
  • モンテカルロシミュレーションを用いてオフラインでトレーニングされ、低計算コストで効率的なオンライン実装が可能となる。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習に基づく状態推定器は、初期誤差やノイズ強度に関する仮定に依存せずに、有界な推定誤差を達成できるか?
  • RQ2リャプノフ安定性理論は、モデルフリー強化学習フレームワークに効果的に統合可能であり、推定誤差の収束を保証できるか?
  • RQ3ノイズ分散の変化やランダムな測定値の欠落といったシステムの不確実性下で、提案手法はどのように性能を発揮するか?
  • RQ4システムモデルが非線形的かつ非ガウス的である場合でも、推定器は安定性と精度を維持できるか?
  • RQ5同一のシミュレーション条件下で、提案手法と古典的フィルタ(EKF、UKF、PF)との性能差はどの程度か?

主な発見

  • 提案されたリャプノフに基づく強化学習状態推定器(LRLF)は、初期誤差やノイズ強度に関する仮定なしに、理論的保証のもとで有界な推定誤差を達成する。
  • 振り子の追従ケースでは、ノイズ分散の変化や測定値の欠落といったモデル不確実性下でも、LRLFはEKF、UKF、PFを上回る安定した推定誤差の収束を示した。
  • 車両追跡ケースでは、LRLFは位置と速度の両方を最適カルマンフィルタに近い精度で推定したが、システムの非線形性と非ガウス性のためわずかに高い誤差が予想された。
  • 航空機搭載標的追跡シナリオでは、LRLFは測定が方位のみ(bearing-only)で、観測モデルが非線形である状況下でも、誤差が小さく、信頼性の高い信頼区間を示しながら、動きのある地上車両の状態を効果的に追跡した。
  • 500回のモンテカルロシミュレーションでは、すべてのテストケースで一貫した性能が確認され、不確実性下でもLRLFは既存のフィルターより優れた収束性とロバストネスを示した。
  • 著者らの知る限り、本手法は、強化学習に基づく非線形状態推定器に対して、理論的性能保証(有界誤差)を提供する最初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。