Skip to main content
QUICK REVIEW

[论文解读] Reward Estimation for Variance Reduction in Deep Reinforcement Learning

Joshua Romoff, Peter Henderson|arXiv (Cornell University)|May 9, 2018
Reinforcement Learning in Robotics参考文献 39被引用 12
一句话总结

本论文提出了一种奖励估计方法,通过学习预期奖励的直接估计器来减少深度强化学习中的方差,从而在训练过程中替代噪声大或受损的采样奖励。该方法在多种随机噪声类型下,于MuJoCo和Atari环境中均显著降低了方差,提升了表格型和深度强化学习设置下的样本效率与收敛性,实验结果表明性能显著提升。

ABSTRACT

Reinforcement Learning (RL) agents require the specification of a reward signal for learning behaviours. However, introduction of corrupt or stochastic rewards can yield high variance in learning. Such corruption may be a direct result of goal misspecification, randomness in the reward signal, or correlation of the reward with external factors that are not known to the agent. Corruption or stochasticity of the reward signal can be especially problematic in robotics, where goal specification can be particularly difficult for complex tasks. While many variance reduction techniques have been studied to improve the robustness of the RL process, handling such stochastic or corrupted reward structures remains difficult. As an alternative for handling this scenario in model-free RL methods, we suggest using an estimator for both rewards and value functions. We demonstrate that this improves performance under corrupted stochastic rewards in both the tabular and non-linear function approximation settings for a variety of noise types and environments. The use of reward estimation is a robust and easy-to-implement improvement for handling corrupted reward signals in model-free RL.

研究动机与目标

  • 为解决由随机或受损奖励信号引起的深度强化学习中高方差问题,特别是在目标设定具有挑战性的机器人领域。
  • 开发一种实用的、无需模型的无模型方法,提升学习稳定性与样本效率,且无需建模环境动态。
  • 证明在表格型和深度函数逼近设置中,估计预期奖励而非使用原始采样奖励,可降低方差并提升性能。
  • 提供一种简单、稳健且易于实现的替代方案,以替代现有方差减少技术中未显式处理奖励损坏的方法。

提出的方法

  • 该方法用学习到的估计器 $ \hat{R}(s_t) $ 替换采样奖励 $ r_t $,该估计器对每个状态的局部预期奖励进行估计。
  • 使用历史状态-奖励对,通过独立的神经网络或函数逼近器训练预测 $ \hat{R}(s_t) $,最小化与真实预期奖励之间的均方误差。
  • 在贝尔曼备份和策略梯度更新中使用估计奖励 $ \hat{R}(s_t) $ 替代 $ r_t $,从而降低价值函数和策略学习中的方差。
  • 使用估计奖励更新价值函数 $ V^\pi(s_t) $,其时序差分目标为:$ Y_t = \hat{R}(s_t) + \gamma V^\pi(s_{t+1}) $。
  • 该方法被应用于表格型MDP和深度强化学习算法(包括PPO和SAC),在连续控制(MuJoCo)和离散控制(Atari)基准测试中均有效。
  • 该方法避免建模动态或规划,仅专注于奖励信号校正,因此轻量化且与现有无模型强化学习框架高度兼容。

实验结果

研究问题

  • RQ1在深度强化学习中,当奖励信号受损时,学习预期奖励的直接估计器是否能降低价值函数和策略更新的方差?
  • RQ2当奖励具有随机性、稀疏性或受噪声污染时,奖励估计与标准强化学习训练相比表现如何?
  • RQ3所提出方法在MuJoCo运动控制等连续控制任务中是否保持或提升样本效率与最终性能?
  • RQ4与使用原始采样奖励相比,该方法在贝尔曼备份算子中能将方差降低多少?
  • RQ5奖励估计的优势是否在不同类型的奖励损坏(高斯噪声、均匀噪声、稀疏性)和不同环境中保持一致?

主要发现

  • 在HalfCheetah-v2环境中,当存在40%稀疏性噪声时,估计奖励 $ \hat{R} $ 的方差降至29.989,远低于受损奖励 $ R_{corr} $ 的163.790,表明方差显著降低。
  • 在Hopper-v2环境中,当稀疏性噪声高达95%时,$ \hat{R} $ 的方差降至4.146,相比 $ R_{corr} $ 的72.268,显示出在极端损坏情况下的鲁棒性。
  • 在Reacher-v2环境中,当高斯噪声标准差 $ \sigma = 0.4 $ 时,$ \hat{R} $ 的方差为1.481,而 $ R_{corr} $ 为13.629,表明方差减少具有一致性。
  • 估计值 $ \hat{R} $ 与真实奖励 $ R_{true} $ 之间的均方误差(MSE)始终低于 $ R_{corr} $ 与 $ R_{true} $ 之间的MSE,证实了估计器的准确性。
  • 在所有环境中,使用 $ \hat{R} $ 均实现了更快的收敛速度和更优的最终性能,MuJoCo和Atari基准测试中TD误差降低,学习曲线更加稳定。
  • 该方法在不修改底层强化学习算法的前提下实现了显著的性能提升,表明其具有广泛的兼容性和实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。