Skip to main content
QUICK REVIEW

[論文レビュー] Non-Stationary Markov Decision Processes, a Worst-Case Approach using Model-Based Reinforcement Learning, Extended version

Erwan Lecarpentier, Emmanuel Rachelson|arXiv (Cornell University)|Apr 22, 2019
Reinforcement Learning in Robotics参考文献 31被引用数 4
ひとこと要約

本稿では、リップシッツ連続的な時間変動ダイナミクスを有する非定常マルコフ決定過程(NSMDP)を対象とするモデルベース強化学習アルゴリズムであるリスク回避的木探索(RATS)を提案する。RATSは、環境の変化を敵対的とみなして、最悪のモデル進化のもとで計画を実行することで、あらゆる可能な進化に対して一貫した性能を確保し、最悪の状況下での報酬を最大化する。実験では、環境の変動具合を制御するパラメータ ε を用いたグリッドワールドベンチマークで、その有効性が実証された。

ABSTRACT

This work tackles the problem of robust zero-shot planning in non-stationary stochastic environments. We study Markov Decision Processes (MDPs) evolving over time and consider Model-Based Reinforcement Learning algorithms in this setting. We make two hypotheses: 1) the environment evolves continuously with a bounded evolution rate; 2) a current model is known at each decision epoch but not its evolution. Our contribution can be presented in four points. 1) we define a specific class of MDPs that we call Non-Stationary MDPs (NSMDPs). We introduce the notion of regular evolution by making an hypothesis of Lipschitz-Continuity on the transition and reward functions w.r.t. time; 2) we consider a planning agent using the current model of the environment but unaware of its future evolution. This leads us to consider a worst-case method where the environment is seen as an adversarial agent; 3) following this approach, we propose the Risk-Averse Tree-Search (RATS) algorithm, a zero-shot Model-Based method similar to Minimax search; 4) we illustrate the benefits brought by RATS empirically and compare its performance with reference Model-Based algorithms.

研究の動機と目的

  • 時間経過に伴い変化するが、変化率に上限がある非定常な確率的環境における頑健な計画を扱う。
  • 時間に沿って変化する遷移関数および報酬関数がリップシッツ連続である非定常MDP(NSMDP)のクラスを形式化する。
  • 現在のモデルは把握しているが、その将来の進化は不明な状況下で、最悪の環境進化を仮定することで、モデルの不確実性に対処する計画アルゴリズムを開発する。
  • あらゆる可能な将来的な環境進化に対して、達成可能な最小報酬を最大化する手法を設計し、頑健性を確保する。
  • 提案手法が、標準的なモデルベース手法よりも最悪ケース性能保証において優れていることを実証的に検証する。

提案手法

  • 時間依存MDPとして非定常MDP(NSMDP)を定義し、遷移関数および報酬関数が時間に関してリップシッツ連続であると仮定する。
  • 環境を最小化するように行動する敵対的エージェントとみなす最悪ケース計画法を定式化する。
  • リスク回避的木探索(RATS)アルゴリズムを提案する。これは、最悪の状況を想定したもとで、将来のモデル進化の可能性を木構造で探索するミニマックス型の探索手法である。
  • 探索深さパラメータ $d_{\text{max}}$ を用いて、最悪の将来モデルの近似を制御し、葉ノードは終端状態を表す。
  • RATSを用いて、あらゆる可能な進化に対して下限が最大となる方策を計算し、頑健性を確保する。
  • パラメータ $\epsilon$ を用いて環境の変動を制御するグリッドワールド環境で、RATSをベースラインのモデルベースアルゴリズム(例:DP-snapshot, DP-NSMDP)と比較する。

実験結果

リサーチクエスチョン

  • RQ1モデルベース強化学習エージェントが、現在のモデルしか把握していないが、将来の進化は不明な非定常環境において、頑健な性能を達成できるか?
  • RQ2時間変動ダイナミクスにリップシッツ連続性制約を課したNSMDPにおいて、最悪ケース計画をどのように形式化できるか?
  • RQ3敵対的環境進化を仮定するミニマックス型計画法は、標準的な期待報酬最大化法に比べて、より優れた最悪ケース性能保証を達成できるか?
  • RQ4提案手法は、従来のモデルベースプランナーよりも環境の変動に対する感度をどの程度低減できるか?
  • RQ5有界なモデル進化のもとで、有限深さの木探索を用いて最悪ケース報酬を効果的に近似できるか?

主な発見

  • RATSは、環境の変動方向を制御するパラメータ $\epsilon$ の値に関わらず一貫した高い性能を示し、モデル進化に対する頑健性を実証した。
  • DP-snapshotは $\epsilon=0$(有利な変動)のときには良好な性能を示すが、$\epsilon=1$ のときには崩壊的に失敗し、その頑健性の欠如が明らかになった。
  • RATSの報酬分布は、ベースライン手法と比較して顕著に左端の尾部が短く、低報酬のリスクが低いことを示している。
  • RATSは5%のCVaR(条件付きリスク価値)において、期待報酬最適化を目的とするDP-snapshotおよびDP-NSMDPを上回り、最高の性能を達成した。
  • RATSの最悪ケース報酬は、あらゆる可能な進化に対して最大化されており、最小達成可能報酬を効果的に最適化していることが確認された。
  • 実験結果から、RATSは環境が敵対的に進化する状況でも強力な性能を維持しており、最悪ケース計画アプローチの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。