Skip to main content
QUICK REVIEW

[论文解读] Convergent and Efficient Deep Q Network Algorithm

Zhikang T. Wang, Masahito Ueda|arXiv (Cornell University)|Jun 29, 2021
Reinforcement Learning in Robotics参考文献 51被引用 5
一句话总结

本文提出C-DQN,一种收敛且高效的深度Q网络算法,通过消除目标网络更新期间的损失增加,确保损失单调下降,即使在高折扣因子(高达~0.9998)下也能保证收敛。该方法在标准DQN失败的多个Atari 2600游戏中成功实现学习,展示了在复杂环境中的鲁棒性与可扩展性。

ABSTRACT

Despite the empirical success of the deep Q network (DQN) reinforcement learning algorithm and its variants, DQN is still not well understood and it does not guarantee convergence. In this work, we show that DQN can indeed diverge and cease to operate in realistic settings. Although there exist gradient-based convergent methods, we show that they actually have inherent problems in learning dynamics which cause them to fail even in simple tasks. To overcome these problems, we propose a convergent DQN algorithm (C-DQN) that is guaranteed to converge and can work with large discount factors (0.9998). It learns robustly in difficult settings and can learn several difficult games in the Atari 2600 benchmark that DQN fails to solve. Our codes have been publicly released and can be used to reproduce our results.

研究动机与目标

  • 解决尽管深度Q网络(DQN)算法在实践中表现成功,但缺乏理论收敛保证的问题。
  • 识别出现有基于梯度的收敛方法在实际中存在学习动态差的问题,且在简单任务上即告失败。
  • 开发一种新型DQN变体,保证收敛的同时保持效率与大规模强化学习任务的可扩展性。
  • 实现在高折扣因子(γ ≈ 0.9998)下的稳定训练,并在具有挑战性的Atari 2600环境中实现鲁棒性能。

提出的方法

  • 提出一种改进的损失函数,确保在目标网络更新时损失不会增加,从而保证损失单调下降与收敛。
  • 使用归一化的Q函数 \hat{Q} = (Q - μ)/σ 来稳定训练,其中μ和σ基于初始经验转移计算得出。
  • 对Q值更新应用改进的学习规则,防止在Q值相等时对贪婪策略行为产生意外改变。
  • 引入一种时间尺度感知的归一化策略,利用γ₀来对齐随机策略与学习策略之间的奖励动态。
  • 实现一种目标网络更新机制,通过基于贝尔曼方程的改进更新规则,从构造上避免损失增加。
  • 实验中使用学习率为4×10⁻⁵,γ₀ = 0.9998,归一化基于前50,000次转移计算得出,排除无回报的episode。

实验结果

研究问题

  • RQ1能否设计一种深度Q网络算法,保证收敛的同时保持效率与可扩展性?
  • RQ2为何现有基于梯度的收敛方法在实际中失败,尽管具有理论收敛保证?
  • RQ3DQN在真实环境中发散的原因是什么,能否从理论上加以解决?
  • RQ4能否构造一种损失函数,使其在函数逼近下仍能单调下降?
  • RQ5对Q值进行归一化如何影响高折扣因子设置下的学习稳定性与收敛性?

主要发现

  • C-DQN在训练过程中保证损失函数单调下降,确保理论收敛。
  • 该算法成功学习了多个标准DQN失败的Atari 2600游戏,包括Hero和Montezuma’s Revenge。
  • C-DQN在高折扣因子(γ ≈ 0.9998)下实现稳定训练,支持有效的长时程规划。
  • 利用初始经验计算得出的μ和σ对Q值进行归一化,可提升训练稳定性与收敛性。
  • 如图15所示,在相同实验设置下,该方法在多个游戏中优于Double DQN与人类基准表现。
  • 尽管有所改进,该归一化策略在高度随机的环境(如Breakout)中仍表现吃力,因随机策略与学习策略之间的奖励动态差异显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。