Skip to main content
QUICK REVIEW

[論文レビュー] No-Regret Reinforcement Learning with Heavy-Tailed Rewards

Vincent Zhuang, Yanan Sui|arXiv (Cornell University)|Feb 25, 2021
Advanced Bandit Algorithms Research参考文献 29被引用数 4
ひとこと要約

本稿では、有限な$(1+\epsilon)$-次モーメントを持つ重尾報酬を伴うMDPに対して設計された、ロバスト強化学習アルゴリズムであるHeavy-UCRL2およびHeavy-Q-Learningを提案する。中央極限定理の代わりに、メジアン・オブ・ミーンズのようなロバスト平均推定技術を活用することで、報酬推定が学習の難易度を支配する重尾状態において、近似的に最適なレグレットバウンドを達成する。このアプローチは、Heavy-DQNを介して深層強化学習へと一般化され、合成的および標準的なベンチマークでベースラインを上回る性能を示す。

ABSTRACT

Reinforcement learning algorithms typically assume rewards to be sampled from light-tailed distributions, such as Gaussian or bounded. However, a wide variety of real-world systems generate rewards that follow heavy-tailed distributions. We consider such scenarios in the setting of undiscounted reinforcement learning. By constructing a lower bound, we show that the difficulty of learning heavy-tailed rewards asymptotically dominates the difficulty of learning transition probabilities. Leveraging techniques from robust mean estimation, we propose Heavy-UCRL2 and Heavy-Q-Learning, and show that they achieve near-optimal regret bounds in this setting. Our algorithms also naturally generalize to deep reinforcement learning applications; we instantiate Heavy-DQN as an example of this. We demonstrate that all of our algorithms outperform baselines on both synthetic MDPs and standard RL benchmarks.

研究の動機と目的

  • MDPにおける重尾報酬分布を伴う強化学習について、理論的および実験的研究の不足に対処すること。
  • 重尾報酬の学習が、遷移確率の学習を上回り、学習の主な難易度要因となることを示すこと。
  • 重尾報酬下で近似的に最適なレグレットを達成する、信頼区間に基づく強化学習アルゴリズムであるHeavy-UCRL2およびHeavy-Q-Learningの設計と分析を行うこと。
  • Heavy-DQNを介して、深層強化学習へのフレームワークの一般化を行い、実用的応用の可能性を示すこと。

提案手法

  • 有限な$(1+\epsilon)$-次モーメントを持つ報酬を扱うために、中央極限定理の代わりにメジアン・オブ・ミーンズによるロバスト平均推定を用いる。
  • UCRL2およびQ学習における標準的な信頼区間を、重尾分布のための濃度不等式に基づくロバストな類似物に置き換える。
  • 未収束する重尾状態において、報酬推定の難易度が遷移学習を上回ることを示す下界を構築する。
  • ロバスト分散および不確実性項を組み込んだ、重尾報酬下での信頼区間ベースのアルゴリズムのレグレットをバウンドする、新しい分析フレームワークを採用する。
  • 同じロバスト推定原理を深層Qネットワークに適用し、より高いサンプル効率と安定性を実現したHeavy-DQNを導出する。
  • 合成MDP(SixArms、DoubleChain)および標準的な強化学習ベンチマークを用いた実験により、理論的主張を検証する。

実験結果

リサーチクエスチョン

  • RQ1有限な$(1+\epsilon)$-次モーメントを持つ重尾報酬分布に従うMDPの学習において、根本的な難易度は何であるか?
  • RQ2ロバスト平均推定技術は、UCRL2やQ学習のような信頼区間ベースの強化学習アルゴリズムに効果的に適応可能か?
  • RQ3無割引MDPにおいて、重尾報酬の学習難易度が遷移ダイナミクスの学習難易度を上回るか?
  • RQ4ロバスト強化学習アルゴリズムは、重尾状態において近似的に最適なレグレットバウンドを達成可能か?
  • RQ5ロバストアルゴリズムは、深層強化学習アーキテクチャへとどのように一般化可能か?

主な発見

  • 本稿では、無割引MDPにおいて、重尾報酬の学習が漸近的に遷移確率の学習を上回る難易度を支配することを示す理論的下界を確立した。
  • Heavy-UCRL2およびHeavy-Q-Learningは、有限な$(1+\epsilon)$-次モーメントの仮定の下で、尾指数$\epsilon$に明示的な依存関係を示しながら、近似的に最適なレグレットバウンドを達成する。
  • レグレットバウンドは$H^{3}SA\iota^{2}\sqrt{r_{\text{max}}^{3}}$および$H^{\frac{1+3\epsilon}{\epsilon}}\sqrt{S^{3}A^{3}\iota^{4}\epsilon}$に比例し、重尾推定の複雑さの増加を反映している。
  • 同じロバスト推定原理に基づいて導出されたHeavy-DQNは、合成MDPおよび標準的な強化学習ベンチマークにおいて、標準DQNを上回る性能を示した。
  • SixArmsおよびDoubleChain MDPにおける実験結果から、Heavy-UCRL2およびHeavy-Q-Learningは標準ベースラインを常に顕著に上回る性能を示した。
  • アルゴリズムは極端な報酬外れ値に対してもロバストであり、報酬が重尾的である状況でも安定した学習を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。