[论文解读] No-Regret Reinforcement Learning with Heavy-Tailed Rewards
该论文提出了Heavy-UCRL2和Heavy-Q-Learning,这两种鲁棒强化学习算法专为具有重尾奖励(有限$(1+\epsilon)$-阶矩)的MDP设计。通过利用中位数-均值等鲁棒均值估计技术,算法在重尾分布环境下实现了近乎最优的遗憾边界,其中奖励估计成为学习难度的主要来源。该方法通过Heavy-DQN推广至深度强化学习,在合成数据集和标准基准测试中表现优于基线模型。
Reinforcement learning algorithms typically assume rewards to be sampled from light-tailed distributions, such as Gaussian or bounded. However, a wide variety of real-world systems generate rewards that follow heavy-tailed distributions. We consider such scenarios in the setting of undiscounted reinforcement learning. By constructing a lower bound, we show that the difficulty of learning heavy-tailed rewards asymptotically dominates the difficulty of learning transition probabilities. Leveraging techniques from robust mean estimation, we propose Heavy-UCRL2 and Heavy-Q-Learning, and show that they achieve near-optimal regret bounds in this setting. Our algorithms also naturally generalize to deep reinforcement learning applications; we instantiate Heavy-DQN as an example of this. We demonstrate that all of our algorithms outperform baselines on both synthetic MDPs and standard RL benchmarks.
研究动机与目标
- 解决在MDP中重尾奖励分布的强化学习理论与实证研究不足的问题。
- 证明学习重尾奖励成为主导困难来源,其难度超过转移概率的学习。
- 设计并分析基于置信区间的强化学习算法——Heavy-UCRL2和Heavy-Q-Learning,使其在重尾奖励下实现近乎最优的遗憾边界。
- 通过Heavy-DQN将该框架推广至深度强化学习,展示其实际适用性。
提出的方法
- 使用中位数-均值方法进行鲁棒均值估计,以处理仅具有有限$(1+\epsilon)$-阶矩的奖励。
- 在UCRL2和Q-learning中,用基于重尾分布浓度不等式的鲁棒置信区间替代标准置信区间。
- 构建一个下界,证明在无界重尾设定下,奖励估计的困难程度超过转移学习的困难。
- 提出一种新颖的分析框架,用于在重尾奖励下界定基于置信区间的算法的遗憾,整合了鲁棒方差和不确定性项。
- 将相同的鲁棒估计原则应用于深度Q网络,得到性能更优的Heavy-DQN,具备更高的样本效率和稳定性。
- 通过在合成MDP(SixArms、DoubleChain)和标准强化学习基准测试上的实验,验证了理论结论。
实验结果
研究问题
- RQ1当奖励服从仅具有有限$(1+\epsilon)$-阶矩的重尾分布时,学习MDP的根本困难是什么?
- RQ2鲁棒均值估计技术能否有效适配到如UCRL2和Q-learning等基于置信区间的强化学习算法?
- RQ3在无折扣MDP中,学习重尾奖励的困难是否超过学习转移动态的困难?
- RQ4鲁棒强化学习算法能否在重尾设定下实现近乎最优的遗憾边界?
- RQ5鲁棒算法能否有效推广到深度强化学习架构?
主要发现
- 论文建立了理论下界,表明在无折扣MDP中,学习重尾奖励的困难在渐近意义上主导了学习转移概率的困难。
- Heavy-UCRL2和Heavy-Q-Learning在假设奖励具有有限$(1+\epsilon)$-阶矩的前提下,实现了近乎最优的遗憾边界,且遗憾边界显式依赖于尾指数$\epsilon$。
- 遗憾边界与$H^{3}SA\iota^{2}\sqrt{r_{\text{max}}^{3}}$和$H^{\frac{1+3\epsilon}{\epsilon}}\sqrt{S^{3}A^{3}\iota^{4}\epsilon}$成比例,反映了重尾估计复杂性的提升。
- 由相同鲁棒估计原则衍生出的Heavy-DQN,在合成MDP和标准强化学习基准测试中均优于标准DQN。
- 在SixArms和DoubleChain MDP上的实证结果表明,Heavy-UCRL2和Heavy-Q-Learning在性能上持续且显著优于标准基线模型。
- 这些算法对极端奖励异常值表现出鲁棒性,在奖励呈现重尾行为时仍能保持稳定学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。