Skip to main content
QUICK REVIEW

[论文解读] On-Policy Deep Reinforcement Learning for the Average-Reward Criterion

Yiming Zhang, Keith W. Ross|arXiv (Cornell University)|Jun 14, 2021
Reinforcement Learning in Robotics被引用 12
一句话总结

本文提出了一种新型的基于策略的深度强化学习算法——平均奖励TRPO(ATRPO),用于持续性任务,通过直接优化长期平均奖励准则。该方法基于平均策略差异和基梅尼常数推导出一个理论上有依据的策略改进边界,实现了单调的策略改进;在具有挑战性的MuJoCo环境中,ATRPO显著优于标准TRPO,尤其在高维控制任务中表现突出。

ABSTRACT

We develop theory and algorithms for average-reward on-policy Reinforcement Learning (RL). We first consider bounding the difference of the long-term average reward for two policies. We show that previous work based on the discounted return (Schulman et al., 2015; Achiam et al., 2017) results in a non-meaningful bound in the average-reward setting. By addressing the average-reward criterion directly, we then derive a novel bound which depends on the average divergence between the two policies and Kemeny's constant. Based on this bound, we develop an iterative procedure which produces a sequence of monotonically improved policies for the average reward criterion. This iterative procedure can then be combined with classic DRL (Deep Reinforcement Learning) methods, resulting in practical DRL algorithms that target the long-run average reward criterion. In particular, we demonstrate that Average-Reward TRPO (ATRPO), which adapts the on-policy TRPO algorithm to the average-reward criterion, significantly outperforms TRPO in the most challenging MuJuCo environments.

研究动机与目标

  • 解决标准深度强化学习算法(优化折扣回报)与真实世界持续性任务(需要最大化长期平均奖励)之间的不匹配问题。
  • 克服现有策略改进边界在应用于平均奖励MDP时的局限性——这些边界最初是为折扣设置推导的。
  • 开发一种理论坚实、基于策略的算法,通过一种新型的长期平均奖励差异下界,直接优化平均奖励准则。
  • 在高维、具有挑战性的MuJoCo控制基准上,展示所提方法在实际性能上优于标准TRPO。
  • 建立一个将平均奖励优化集成到现代深度强化学习流水线中的框架,尤其适用于基于策略的算法。

提出的方法

  • 推导出两个策略之间平均奖励差异的新下界,其依赖于平均策略差异和基梅尼常数——一个衡量马尔可夫链混合时间的指标。
  • 证明最大化该下界可实现平均奖励的单调改进,将策略改进定理扩展至平均奖励设置。
  • 将信任区域策略优化(TRPO)算法适配至平均奖励准则,从而得到平均奖励TRPO(ATRPO)算法。
  • 使用广义优势估计(GAE)进行价值函数近似,并对每个小批量的的优势进行归一化,以稳定训练过程。
  • 在MuJoCo环境中引入重置成本机制,以模拟无限时域动态,并实现与折扣方法的公平比较。
  • 使用相同的超参数和随机种子训练并评估ATRPO与TRPO,通过不同长度的评估轨迹评估性能稳定性。

实验结果

研究问题

  • RQ1能否为平均奖励准则推导出一个理论上有依据的策略改进边界,以避免基于折扣回报的边界在该情境下的缺陷?
  • RQ2直接优化平均奖励准则是否在持续性任务的深度强化学习中优于使用大折扣因子?
  • RQ3在高维MuJoCo控制任务中,ATRPO与标准TRPO在样本效率和最终性能方面相比如何?
  • RQ4ATRPO的性能是否对用于模拟无限时域动态的重置成本等超参数敏感?
  • RQ5所提出的平均奖励框架能否与现代基于策略的深度强化学习算法(如TRPO)有效结合?

主要发现

  • 为平均奖励设置推导出的策略改进边界具有实际意义,并能保证单调改进,而以往基于折扣的边界在此情境下失效。
  • ATRPO在所有MuJoCo环境中均显著优于TRPO,尤其在最富挑战性的任务(如Humanoid和Ant)中,性能提升极为显著。
  • 即使重置成本大幅变化,ATRPO仍保持强劲性能,表明其在仿真设置中超参数选择上具有鲁棒性。
  • ATRPO在有无重置成本的TRPO训练下均表现更优,证明性能提升并非源于重置机制,而是源于底层的平均奖励优化。
  • 在更长的评估轨迹(如10,000步)上,ATRPO与TRPO的性能差距进一步扩大,证实ATRPO能更好地捕捉长期行为,优于基于折扣的基线。
  • 在理论边界中引入基梅尼常数,为链的混合性提供了有意义的度量,将理论特性与实际算法设计有效关联。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。