Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Percentile Criterion Using Robust MDPs

Bahram Behzadian, Reazul Hasan Russel|arXiv (Cornell University)|Oct 23, 2019
Reinforcement Learning in Robotics参考文献 31被引用数 5
ひとこと要約

本論文は、データが限られる強化学習におけるパcentile基準を最適化するための新規手法を提案する。ロバストMDP(RMDP)におけるあいまいさ集合のスパンを最小化することで、性能損失を顕著に低減する。重み付き$L_1$および$L_\infty$ノルムを用いてあいまいさ集合の形状を制御することで、一様ノルムベースラインと比較して、ベイズ的帰属では最大2.8倍、頻度的帰属では1.6倍の向上を達成する。

ABSTRACT

We address the problem of computing reliable policies in reinforcement learning problems with limited data. In particular, we compute policies that achieve good returns with high confidence when deployed. This objective, known as the \emph{percentile criterion}, can be optimized using Robust MDPs~(RMDPs). RMDPs generalize MDPs to allow for uncertain transition probabilities chosen adversarially from given ambiguity sets. We show that the RMDP solution's sub-optimality depends on the spans of the ambiguity sets along the value function. We then propose new algorithms that minimize the span of ambiguity sets defined by weighted $L_1$ and $L_\infty$ norms. Our primary focus is on Bayesian guarantees, but we also describe how our methods apply to frequentist guarantees and derive new concentration inequalities for weighted $L_1$ and $L_\infty$ norms. Experimental results indicate that our optimized ambiguity sets improve significantly on prior construction methods.

研究の動機と目的

  • 低データ環境における強化学習のポリシーの信頼性を向上させることを目的とし、高信頼性の帰属保証を最大化すること。
  • 従来の手法におけるあいまいさ集合の形状が不適切であるために生じるRMDPポリシーの劣化を是正すること。
  • 価値関数方向に沿ったあいまいさ集合のスパンを最小化する手法を構築し、性能境界を向上させること。
  • ベイズ的および頻度的設定の両方において、重み付き$L_1$および$L_\infty$ノルムのための新しい集中不等式を導出すること。
  • スパン最適化されたあいまいさ集合が、標準的な構築法と比較して顕著にタイトな帰属保証を達成することを実証的に検証すること。

提案手法

  • 価値関数方向に沿ったあいまいさ集合のスパンに依存する、RMDPの新たなパフォーマンス損失バウンディングを提案。体積ではなくスパンに依存する。
  • 重み付き$L_1$および$L_\infty$ノルムによって定義される非対称なあいまいさ集合を導入し、遷移確率の不確実性をより適切に捉える。
  • あいまいさ集合のスパンを最小化するための重みを最適化する線形時間アルゴリズムを提案。これにより、より高いロバスト性を実現。
  • ベイズ的および頻度的不確実性評価を支援する、重み付き$L_1$および$L_\infty$ノルムのための新しい高信頼性集中不等式を導出。
  • 最適化されたあいまいさ集合をRMDPフレームワークに適用し、エピステミック不確実性下での帰属保証をタイトにしたポリシーを計算。
  • 二段階アプローチを採用:まずスパンを最小化するための重みを最適化し、次にサンプリング保証を用いてあいまいさ集合のサイズをキャリブレーション。

実験結果

リサーチクエスチョン

  • RQ1価値関数方向に沿ったあいまいさ集合のスパンは、RMDPポリシーのパフォーマンス損失にどのように影響するか?
  • RQ2重み付き$L_1$および$L_\infty$ノルムによるあいまいさ集合の形状最適化は、一様ノルム構築法と比較してRMDPポリシーのパフォーマンス損失を低減できるか?
  • RQ3ベイズ的および頻度的不確実性評価を支援する、重み付き$L_1$および$L_\infty$ノルムのための新しい集中不等式は何か?
  • RQ4スパン最適化されたあいまいさ集合は、ベイズ的および頻度的設定の両方で帰属保証をどの程度向上させるか?
  • RQ5提案手法の計算複雑性は状態空間のサイズにどのように依存するか?また、大規模問題へ拡張可能か?

主な発見

  • RMDPポリシーのパフォーマンス損失は、その体積ではなく、価値関数方向に沿ったあいまいさ集合のスパンに主に依存する。
  • 重み付き$L_1$および$L_\infty$ノルムの重みを最適化することで、一様ノルムベースラインと比較して、正規化されたベイズ的パフォーマンス損失が幾何平均で2.8倍改善される。
  • 頻度的設定では、最適化されたあいまいさ集合が、一様構築法と比較して正規化されたパフォーマンス損失を幾何平均で1.6倍改善する。
  • 提案手法は、より良いポリシーとそのパフォーマンスのより正確な境界を同時に計算することで、タイトな帰属保証を達成する。
  • 提案アルゴリズムの計算複雑性は低く保たれ、あいまいさ集合の重みの線形時間最適化が可能である。
  • 5つのベンチマークMDP(RiverSwim, Machine Replacement, Population Growth, Inventory Management, Cart-Pole)における実験結果から、多様なドメインにわたり一貫した改善が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。