Skip to main content
QUICK REVIEW

[论文解读] No-Regret Reinforcement Learning with Heavy-Tailed Rewards

Vincent Zhuang, Yanan Sui|arXiv (Cornell University)|Feb 25, 2021
Advanced Bandit Algorithms Research参考文献 29被引用 4
一句话总结

该论文提出了Heavy-UCRL2和Heavy-Q-Learning,这两种鲁棒强化学习算法专为具有重尾奖励(有限$(1+\epsilon)$-阶矩)的MDP设计。通过利用中位数-均值等鲁棒均值估计技术,算法在重尾分布环境下实现了近乎最优的遗憾边界,其中奖励估计成为学习难度的主要来源。该方法通过Heavy-DQN推广至深度强化学习,在合成数据集和标准基准测试中表现优于基线模型。

ABSTRACT

Reinforcement learning algorithms typically assume rewards to be sampled from light-tailed distributions, such as Gaussian or bounded. However, a wide variety of real-world systems generate rewards that follow heavy-tailed distributions. We consider such scenarios in the setting of undiscounted reinforcement learning. By constructing a lower bound, we show that the difficulty of learning heavy-tailed rewards asymptotically dominates the difficulty of learning transition probabilities. Leveraging techniques from robust mean estimation, we propose Heavy-UCRL2 and Heavy-Q-Learning, and show that they achieve near-optimal regret bounds in this setting. Our algorithms also naturally generalize to deep reinforcement learning applications; we instantiate Heavy-DQN as an example of this. We demonstrate that all of our algorithms outperform baselines on both synthetic MDPs and standard RL benchmarks.

研究动机与目标

  • 解决在MDP中重尾奖励分布的强化学习理论与实证研究不足的问题。
  • 证明学习重尾奖励成为主导困难来源,其难度超过转移概率的学习。
  • 设计并分析基于置信区间的强化学习算法——Heavy-UCRL2和Heavy-Q-Learning,使其在重尾奖励下实现近乎最优的遗憾边界。
  • 通过Heavy-DQN将该框架推广至深度强化学习,展示其实际适用性。

提出的方法

  • 使用中位数-均值方法进行鲁棒均值估计,以处理仅具有有限$(1+\epsilon)$-阶矩的奖励。
  • 在UCRL2和Q-learning中,用基于重尾分布浓度不等式的鲁棒置信区间替代标准置信区间。
  • 构建一个下界,证明在无界重尾设定下,奖励估计的困难程度超过转移学习的困难。
  • 提出一种新颖的分析框架,用于在重尾奖励下界定基于置信区间的算法的遗憾,整合了鲁棒方差和不确定性项。
  • 将相同的鲁棒估计原则应用于深度Q网络,得到性能更优的Heavy-DQN,具备更高的样本效率和稳定性。
  • 通过在合成MDP(SixArms、DoubleChain)和标准强化学习基准测试上的实验,验证了理论结论。

实验结果

研究问题

  • RQ1当奖励服从仅具有有限$(1+\epsilon)$-阶矩的重尾分布时,学习MDP的根本困难是什么?
  • RQ2鲁棒均值估计技术能否有效适配到如UCRL2和Q-learning等基于置信区间的强化学习算法?
  • RQ3在无折扣MDP中,学习重尾奖励的困难是否超过学习转移动态的困难?
  • RQ4鲁棒强化学习算法能否在重尾设定下实现近乎最优的遗憾边界?
  • RQ5鲁棒算法能否有效推广到深度强化学习架构?

主要发现

  • 论文建立了理论下界,表明在无折扣MDP中,学习重尾奖励的困难在渐近意义上主导了学习转移概率的困难。
  • Heavy-UCRL2和Heavy-Q-Learning在假设奖励具有有限$(1+\epsilon)$-阶矩的前提下,实现了近乎最优的遗憾边界,且遗憾边界显式依赖于尾指数$\epsilon$。
  • 遗憾边界与$H^{3}SA\iota^{2}\sqrt{r_{\text{max}}^{3}}$和$H^{\frac{1+3\epsilon}{\epsilon}}\sqrt{S^{3}A^{3}\iota^{4}\epsilon}$成比例,反映了重尾估计复杂性的提升。
  • 由相同鲁棒估计原则衍生出的Heavy-DQN,在合成MDP和标准强化学习基准测试中均优于标准DQN。
  • 在SixArms和DoubleChain MDP上的实证结果表明,Heavy-UCRL2和Heavy-Q-Learning在性能上持续且显著优于标准基线模型。
  • 这些算法对极端奖励异常值表现出鲁棒性,在奖励呈现重尾行为时仍能保持稳定学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。