Skip to main content
QUICK REVIEW

[論文レビュー] Deep Robust Kalman Filter

Shirli Di-Castro Shashua, Shie Mannor|arXiv (Cornell University)|Mar 7, 2017
Bayesian Modeling and Causal Inference参考文献 28被引用数 18
ひとこと要約

本稿では、深層ニューラルネットワークを用いて大規模なロバスト・マークフ・決定過程(RMDP)を解くための2つのアルゴリズム、RTD-DQN および Deep-RoK を提案する。RTD-DQN は、遷移確率の不確実性に対処するため、損失関数にロバスト・ベルマン時系列差分誤差を統合している。一方、Deep-RoK は、この手法を拡張し、拡張カルマンフィルタ(EKF)を用いて価値関数重みと遷移ダイナミクスの両方の不確実性を同時にモデル化することで、パrameter不確実性下での連続的制御タスク(例:カート・ポール)における著しいロバストネスの向上を実現した。

ABSTRACT

A Robust Markov Decision Process (RMDP) is a sequential decision making model that accounts for uncertainty in the parameters of dynamic systems. This uncertainty introduces difficulties in learning an optimal policy, especially for environments with large state spaces. We propose two algorithms, RTD-DQN and Deep-RoK, for solving large-scale RMDPs using nonlinear approximation schemes such as deep neural networks. The RTD-DQN algorithm incorporates the robust Bellman temporal difference error into a robust loss function, yielding robust policies for the agent. The Deep-RoK algorithm is a robust Bayesian method, based on the Extended Kalman Filter (EKF), that accounts for both the uncertainty in the weights of the approximated value function and the uncertainty in the transition probabilities, improving the robustness of the agent. We provide theoretical results for our approach and test the proposed algorithms on a continuous state domain.

研究の動機と目的

  • モデルパラメータに不確実性を伴う大規模なマークフ・決定過程(MDP)において、ロバストな方策を学習する課題に対処すること。
  • 線形近似に依存する、オフライン推定や遷移確率に関する制限的仮定に依存する既存のRMDP手法の限界を克服すること。
  • モデルパラメータの不確実性と価値関数重みの不確実性の両方を考慮した、オンラインで非線形関数近似が可能な手法を開発すること。
  • 自律走行やファイナンスなど、モデル不確実性が深刻な方策失敗を引き起こす可能性がある実世界の分野におけるエージェントのパフォーマンスを向上させること。

提案手法

  • RTD-DQN は、遷移確率の不確実性集合における最悪ケースの価値関数誤差を最小化するために、損失関数内に標準的なベルマン時系列差分(TD)誤差の代わりにロバスト・ベルマンTD誤差(rBTDe)を統合する。
  • rBTDe は、不確実性集合に含まれるすべての妥当な遷移分布に対する最悪ケースの期待リターンを最適化するロバスト・ベルマン作用素から導出される。
  • Deep-RoK は、深層Qネットワークの重みに対するベイズ推論を実行するために拡張カルマンフィルタ(EKF)を用い、価値関数近似の不確実性を多変量正規分布としてモデル化する。
  • EKF は、遷移確率集合 𝒫 からの不確実性を重み不確実性集合 Θ へと伝搬させ、モデルと関数近似の不確実性を同時に推定可能にする。
  • アルゴリズムは、予測と補正ステップをEKFを用いて更新する平均重み推定値 θ̂t|t と共分散行列 Pt|t を維持し、その際、rBTDe をインノベーション項として用いる。
  • 最終的な方策は、モデル不確実性と重み不確実性の両方の下で期待される最悪ケース損失を最小化するロバスト価値関数から導出される。

実験結果

リサーチクエスチョン

  • RQ1遷移確率が不確実な状況下でも、深層強化学習エージェントが大規模MDPでロバストな性能を発揮できるか?
  • RQ2ロバスト時系列差分学習を深層ニューラルネットワークと統合することで、連続的制御タスクにおける標準DQNと比較して方策のロバストネスが向上するか?
  • RQ3EKFベースのベイズフレームワークを用いて、遷移ダイナミクスと価値関数重みの両方の不確実性をモデル化することで、パrameter不一致下での一般化性能が向上するか?
  • RQ4極端なまたは未知のパrameter値でテストされた場合、ロバストエージェントのパフォーマンスは、ノーマルDQNエージェントと比較してどのように異なるか?

主な発見

  • ダブルDQNエージェントは、ノーマルな訓練パラメータ(棒長さ0.5 m、カート質量1.5 kg)では高い累積報酬を得たが、分布外のパラメータ値では性能が急激に低下した。
  • RTD-DQNエージェントは、さまざまな棒長さにおいて一貫したパフォーマンスを示し、rBTDeによる遷移不確実性の明示的モデル化のおかげで、不確実または極端なパラメータ値下でもダブルDQNを上回った。
  • Deep-RoKエージェントは、広範な棒長さ(0.2–1.4 m)とカート質量(0.1–7 kg)の範囲で高いパフォーマンスを維持し、テストスイート全体で最高の成功確率を達成した。
  • Deep-RoKにおけるベイズ不確実性推定は、エージェントが多様なパラメータ組み合わせにおいて一貫してロバストに一般化できることを示し、成功確率の観点でダブルDQNおよびRTD-DQNを上回った。
  • Deep-RoKアルゴリズムは、ロバストEKF損失関数を最小化することを理論的に証明でき、その向上したロバストネスの根拠を裏付けた。
  • 実験的結果は、モデルパラメータと価値関数重みの両方の不確実性を同時にモデル化することで、不確実な環境下でより信頼性が高く安全な方策が得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。