Skip to main content
QUICK REVIEW

[论文解读] Using a Logarithmic Mapping to Enable Lower Discount Factors in Reinforcement Learning

Harm van Seijen, Mehdi Fatemi|arXiv (Cornell University)|Jun 3, 2019
Reinforcement Learning in Robotics参考文献 18被引用 9
一句话总结

本文提出LogDQN,一种将Q值估计映射到对数空间的方法,以在状态空间中统一动作差距,从而在深度强化学习中有效使用低折扣因子。通过减少动作差距大小的方差,LogDQN在稀疏奖励任务(如Atari游戏)中表现更优,尤其在γ = 0.96时,其在人类归一化得分上优于标准DQN和现有基线方法。

ABSTRACT

In an effort to better understand the different ways in which the discount factor affects the optimization process in reinforcement learning, we designed a set of experiments to study each effect in isolation. Our analysis reveals that the common perception that poor performance of low discount factors is caused by (too) small action-gaps requires revision. We propose an alternative hypothesis that identifies the size-difference of the action-gap across the state-space as the primary cause. We then introduce a new method that enables more homogeneous action-gaps by mapping value estimates to a logarithmic space. We prove convergence for this method under standard assumptions and demonstrate empirically that it indeed enables lower discount factors for approximate reinforcement-learning methods. This in turn allows tackling a class of reinforcement-learning problems that are challenging to solve with traditional methods.

研究动机与目标

  • 探究为何低折扣因子在近似强化学习中通常表现不佳,尽管其在理论上具有优势。
  • 识别在函数逼近设置下使用低折扣因子时性能下降的根本原因。
  • 开发一种方法,通过在状态空间中统一动作差距大小,实现低折扣因子的有效学习。
  • 在标准强化学习假设下证明所提方法的收敛性。
  • 通过实证验证该方法在具有挑战性的稀疏奖励环境中的性能提升。

提出的方法

  • 该方法使用可学习的变换将Q值估计映射到对数空间,以减少不同状态间动作差距大小差异的幅度。
  • 采用双头架构:一个头用于正Q值,一个头用于负Q值,各自使用不同的初始基数以保持稳定性。
  • 更新规则在对数空间中应用时序差分学习,最小化变换后值的L2损失。
  • 该方法使用可学习的缩放因子c和对数正则化项,以稳定训练并防止发散。
  • 该方法在标准假设下被证明收敛,包括有界奖励和函数逼近。
  • 该方法被集成到DQN中形成LogDQN,并在具有粘性动作的Atari环境随机版本上进行评估。

实验结果

研究问题

  • RQ1为何低折扣因子在近似强化学习中通常表现不佳,尽管其在有限时域目标下能实现更好的渐近性能?
  • RQ2在函数逼近设置下使用低折扣因子时,性能下降的主要原因是什么?
  • RQ3对值函数空间进行变换能否缓解异质动作差距的负面影响?
  • RQ4在对数空间中学习是否能实现低折扣因子下的稳定且有效的训练?
  • RQ5所提方法能否在Atari游戏等稀疏奖励环境中超越标准DQN和现有基线方法?

主要发现

  • 在55款Atari游戏中,LogDQN实现了106.5%的人类归一化平均得分,显著优于DQN和其他基线方法。
  • 该方法使γ = 0.96得以有效使用,其性能优于DQN基线中的更高折扣因子(如γ = 0.99)。
  • 在55款Atari游戏中,LogDQN在48款游戏中优于DQN,其中15款游戏的性能提升超过50%。
  • LogDQN的中位人类归一化得分为100.5%,表明其在游戏套件中整体表现强劲。
  • 实证结果支持假设:动作差距大小的方差而非动作差距幅度,是低折扣因子性能不佳的主要原因。
  • 该方法在标准假设下表现出收敛性,为其经验成功提供了理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。