Skip to main content
QUICK REVIEW

[论文解读] Prioritized Level Replay

Minqi Jiang, Edward Grefenstette|arXiv (Cornell University)|Oct 8, 2020
Reinforcement Learning in Robotics参考文献 33被引用 4
一句话总结

优先级层级重放(PLR)通过基于估计的未来学习潜力动态选择训练关卡,使用时序差分误差(TD-error)作为代理指标,在程序化内容生成(PCG)环境中提升了样本效率和泛化能力。该方法在ProcGen基准测试中达到最先进性能,测试回报与先前最先进方法持平,并在与已有方法结合时使泛化能力提升超过76%。

ABSTRACT

Environments with procedurally generated content serve as important benchmarks for testing systematic generalization in deep reinforcement learning. In this setting, each level is an algorithmically created environment instance with a unique configuration of its factors of variation. Training on a prespecified subset of levels allows for testing generalization to unseen levels. What can be learned from a level depends on the current policy, yet prior work defaults to uniform sampling of training levels independently of the policy. We introduce Prioritized Level Replay (PLR), a general framework for selectively sampling the next training level by prioritizing those with higher estimated learning potential when revisited in the future. We show TD-errors effectively estimate a level's future learning potential and, when used to guide the sampling procedure, induce an emergent curriculum of increasingly difficult levels. By adapting the sampling of training levels, PLR significantly improves sample efficiency and generalization on Procgen Benchmark--matching the previous state-of-the-art in test return--and readily combines with other methods. Combined with the previous leading method, PLR raises the state-of-the-art to over 76% improvement in test return relative to standard RL baselines.

研究动机与目标

  • 解决深度强化学习在程序化生成环境中的泛化能力差的问题。
  • 通过基于未来学习潜力选择性采样训练关卡,提升样本效率。
  • 开发一种在训练过程中动态调整关卡采样策略的方法,无需依赖预定义的难度排名。
  • 通过聚焦于提供最具信息量学习信号的关卡,实现对未见关卡的更好泛化。

提出的方法

  • PLR利用过去轨迹中的时序差分(TD)误差来估计每个关卡的未来学习潜力。
  • 它维护关卡得分S和陈旧性时间戳C,以平衡学习潜力与经验的新鲜度。
  • 下一个训练关卡从结合了估计学习潜力(S)和陈旧性(C)的分布中采样,其中包含一个权衡参数ρ。
  • 通过统一的采样过程,支持从未见过的关卡采样(来自完整训练集)和重放采样(来自先前见过的关卡)。
  • 该方法兼容任何离策略强化学习算法,并可与数据增强或其他泛化技术结合使用。
  • 关卡得分在每局训练结束后使用包含TD误差和轨迹长度的评分函数进行更新。

实验结果

研究问题

  • RQ1基于估计的学习潜力动态优先选择训练关卡,是否能提升程序化环境中的泛化能力?
  • RQ2使用TD误差作为未来学习潜力的代理指标,对样本效率和测试性能有何影响?
  • RQ3在无先验难度标注的情况下,能否通过学习潜力引导的关卡采样自然形成课程?
  • RQ4当与现有最先进方法结合时,PLR在多大程度上提升泛化能力?
  • RQ5学习潜力与陈旧性之间的平衡(通过ρ调节)是否显著影响在多样化PCG环境中的性能?

主要发现

  • PLR在ProcGen基准测试中与先前最先进方法在测试回报上持平,性能与现有最佳方法相当。
  • 当与先前领先的算法结合时,PLR相比标准强化学习基线,使测试回报提升超过76%。
  • 在16款游戏中,根据优先级策略(按排名或按比例),有10至11款游戏的样本效率和泛化能力得到显著提升。
  • 该方法诱导出一种自适应课程,随着训练推进,学习潜力估计值更高的更难关卡被优先选择。
  • 在16款游戏中的10至11款中,性能提升具有统计显著性(p < 0.05),表明在多样化环境中具有持续的改进效果。
  • 消融实验表明,关卡得分与陈旧性在重放分布中的结合对于性能提升至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。