Skip to main content
QUICK REVIEW

[論文レビュー] Distributional Robustness and Regularization in Reinforcement Learning

Esther Derman, Shie Mannor|arXiv (Cornell University)|Mar 5, 2020
Risk and Portfolio Optimization参考文献 44被引用数 17
ひとこと要約

本稿では、Wassersteinに基づく分布的ロバストなMDPを導入することで、分布的ロバスト強化学習と正則化の二重関係を確立し、有限標本における分布外性能保証を提供する。新たな正則化子が経験的価値関数に作用し、ロバスト価値関数を下から抑え込むことを証明しており、これにより強化学習における外部の不確実性に対して実用的なロバスト性と理論的一般化保証を両立可能にする。

ABSTRACT

Distributionally Robust Optimization (DRO) has enabled to prove the equivalence between robustness and regularization in classification and regression, thus providing an analytical reason why regularization generalizes well in statistical learning. Although DRO's extension to sequential decision-making overcomes $ extit{external uncertainty}$ through the robust Markov Decision Process (MDP) setting, the resulting formulation is hard to solve, especially on large domains. On the other hand, existing regularization methods in reinforcement learning only address $ extit{internal uncertainty}$ due to stochasticity. Our study aims to facilitate robust reinforcement learning by establishing a dual relation between robust MDPs and regularization. We introduce Wasserstein distributionally robust MDPs and prove that they hold out-of-sample performance guarantees. Then, we introduce a new regularizer for empirical value functions and show that it lower bounds the Wasserstein distributionally robust value function. We extend the result to linear value function approximation for large state spaces. Our approach provides an alternative formulation of robustness with guaranteed finite-sample performance. Moreover, it suggests using regularization as a practical tool for dealing with $ extit{external uncertainty}$ in reinforcement learning methods.

研究の動機と目的

  • 分布的ロバスト性と正則化の間のギャップを埋めるために、分布的ロバスト性と正則化の間の双対関係を形式的に定式化すること。
  • モデルの誤指定などの外部の不確実性を扱うために、遷移および報酬分布のWassersteinに基づく不確実性集合を定式化すること。
  • 分布的ロバスト最適化を用いて、ロバスト強化学習方策の有限標本における分布外性能保証を提供すること。
  • 大規模な状態空間における線形価値関数近似へと、ロバスト性と正則化の双対性を拡張すること。
  • 分布的ロバスト方策の挙動を模倣する正則化子を提案し、強化学習における一般化性能を向上させること。

提案手法

  • 経験的遷移および報酬分布を中心とするWasserstein不確実性集合を用いて、Wassersteinに基づく分布的ロバストMDPを提案する。
  • 分布的ロバスト方策の価値を下から抑える経験的価値関数への新しい正則化子を定義する。
  • 分布的ロバスト最適化の双対定式化を用いて、逐次意思決定におけるロバスト性と正則化の関係を導出する。
  • 収縮写像の議論と集中不等式を用いて、ロバスト価値関数に対する有限標本確率的保証を導出する。
  • パラメータ化された価値関数におけるロバスト性を維持する正則化された目的関数を導出することで、線形関数近似への拡張を実現する。
  • 標本サイズと信頼水準に合わせて調整される半径に基づく不確実性集合を用い、Wasserstein距離によって定義する。

実験結果

リサーチクエスチョン

  • RQ1分布的ロバストMDPは、強化学習における正則化と正式に結びつけることができるか?
  • RQ2経験的価値関数への正則化子が、分布的ロバスト価値関数の下界を提供するか?
  • RQ3Wassersteinに基づく分布的ロバスト性の下で訓練された方策に対して、どのような有限標本性能保証を導出できるか?
  • RQ4ロバスト性と正則化の双対性を線形価値関数近似へとどのように拡張できるか?
  • RQ5提案された正則化子は、計算的に困難なロバストMDPを直接解く代替手段として実用的であるか?

主な発見

  • 提案された経験的価値関数への正則化子が、Wassersteinに基づく分布的ロバスト方策の価値を下から抑えることを示し、正則化とロバスト性の直接的な双対関係を確立した。
  • 本手法は有限標本における分布外性能保証を提供する:高確率で、不確実性集合内にある任意の真の分布における期待報酬が、ロバスト価値関数によって下から抑え込まれる。
  • 失敗確率がεで抑えられる uniformly な保証が、すべての状態に対して成り立つ。これは経験分布における集中不等式から導出される。
  • 線形価値関数近似の文脈では、正則化された目的関数が同じロバスト性特性を維持するため、大規模な状態空間へのスケーラブルな適用が可能になる。
  • Wasserstein不確実性集合の半径は、標本サイズと信頼水準に合わせて調整され、真の分布が高確率で集合内に存在することを保証する。
  • 本フレームワークは、計算的に困難なロバストMDPを解く代替手段として、正則化が実用的である可能性を示唆しており、特にデータが限られる状況において顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。