Skip to main content
QUICK REVIEW

[论文解读] An Equivalence between Loss Functions and Non-Uniform Sampling in Experience Replay

Scott Fujimoto, David Meger|arXiv (Cornell University)|Jul 12, 2020
Mental Health Research Topics被引用 14
一句话总结

本文建立了优先经验回放(PER)中非均匀采样与修改后损失函数之间的理论等价性,表明任何PER方案均可通过使用能产生相同期望梯度的变换损失函数,以均匀采样替代。令人惊讶的是,在某些环境中,标准PER可被均匀采样与新损失函数完全替代而性能不降级,由此提出损失调整优先经验回放(LAP)与优先近似损失(PAL),在MuJoCo和Atari环境中提升了训练稳定性和性能。

ABSTRACT

Prioritized Experience Replay (PER) is a deep reinforcement learning technique in which agents learn from transitions sampled with non-uniform probability proportionate to their temporal-difference error. We show that any loss function evaluated with non-uniformly sampled data can be transformed into another uniformly sampled loss function with the same expected gradient. Surprisingly, we find in some environments PER can be replaced entirely by this new loss function without impact to empirical performance. Furthermore, this relationship suggests a new branch of improvements to PER by correcting its uniformly sampled loss function equivalent. We demonstrate the effectiveness of our proposed modifications to PER and the equivalent loss function in several MuJoCo and Atari environments.

研究动机与目标

  • 通过将非均匀采样与等价损失函数关联,为优先经验回放(PER)建立理论基础。
  • 解决PER广泛使用但缺乏正式理论依据的问题。
  • 表明PER的性能优势可能源于梯度等价性,而非采样偏差本身。
  • 提出LAP与PAL作为PER的简化、无偏替代方案,消除重要性采样需求并降低算法复杂度。
  • 通过实证验证,新方法在MuJoCo与Atari基准上优于标准DQN与PER。

提出的方法

  • 推导在非均匀采样数据上训练的损失函数的期望梯度,与在均匀采样数据上训练的另一损失函数的期望梯度之间的数学等价性。
  • 通过基于采样优先级分布调整损失,将任意非均匀采样方案转化为等价的均匀采样损失函数。
  • 提出损失调整优先经验回放(LAP)经验回放,消除重要性采样并设定最小优先级为1,从而降低偏差并防止死过渡。
  • 引入优先近似损失(PAL),一种类似Huber的加权损失函数,可无须非均匀采样即复现LAP的期望梯度。
  • 将损失函数与优先级函数推广至可学习阈值κ,以提升数值稳定性和偏差控制能力。
  • 在MuJoCo与Atari环境中,使用标准超参数与评估协议,对标准DQN算法实现并评估LAP与PAL。

实验结果

研究问题

  • RQ1在经验回放中,非均匀采样能否在均匀采样下通过修改损失函数实现理论等价?
  • RQ2PER的性能提升是否源于采样方案本身,还是源于其产生的梯度更新?
  • RQ3能否在不损失性能的前提下,用均匀采样与新损失函数替代PER?
  • RQ4如何在保持学习效率的同时消除PER中重要性采样引入的偏差?
  • RQ5从损失函数与采样分布之间的等价性中,可对PER带来哪些改进?

主要发现

  • 在非均匀采样数据上训练的损失函数的期望梯度,与在均匀采样数据上训练的另一变换损失函数的期望梯度在数学上等价。
  • 在多个MuJoCo与Atari环境中,用均匀采样与新提出的优先近似损失(PAL)替代PER,性能保持不变或有所提升,表明PER的优势可能源于梯度等价性,而非采样偏差本身。
  • 所提出的损失调整优先经验回放(LAP)通过消除重要性采样并设定最小优先级为1,在性能上优于标准PER,有效降低偏差并防止死过渡。
  • 所提出的PAL损失函数通过引入可学习阈值κ推广了Huber损失,其期望梯度与LAP完全一致,且可无缝集成至任意DQN基算法,仅需极少代码修改。
  • 在MuJoCo的Humanoid任务中,LAP与PAL达到SOTA性能,显著优于基线DQN与PER。
  • 实证结果表明,非均匀采样的方差减少特性通常较弱,实践中新基于损失的方法可完全替代PER而无性能损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。