Skip to main content
QUICK REVIEW

[论文解读] Beyond Target Networks: Improving Deep Q-learning with Functional Regularization.

Alexandre Piché, Joseph Marino|arXiv (Cornell University)|Jun 4, 2021
Reinforcement Learning in Robotics参考文献 53被引用 7
一句话总结

本文提出功能正则化作为深度Q学习中目标网络的替代方案,利用最新的Q网络参数计算目标值,从而在不损失稳定性的情况下加速训练。该方法通过避免目标网络固有的延迟奖励传播,提升了Atari和机器人环境中的样本效率与性能。

ABSTRACT

Target networks are at the core of recent success in Reinforcement Learning. They stabilize the training by using old parameters to estimate the $Q$-values, but this also limits the propagation of newly-encountered rewards which could ultimately slow down the training. In this work, we propose an alternative training method based on functional regularization which does not have this deficiency. Unlike target networks, our method uses up-to-date parameters to estimate the target $Q$-values, thereby speeding up training while maintaining stability. Surprisingly, in some cases, we can show that target networks are a special, restricted type of functional regularizers. Using this approach, we show empirical improvements in sample efficiency and performance across a range of Atari and simulated robotics environments.

研究动机与目标

  • 解决目标网络在延迟传播新遇到奖励方面带来的局限性,这可能导致深度Q学习训练变慢。
  • 开发一种训练方法,在使用当前网络参数进行目标Q值估计的同时保持稳定性。
  • 证明目标网络是功能正则化的受限形式,揭示更广泛的理论框架。
  • 提升深度强化学习环境中(尤其是Atari和模拟机器人任务)的样本效率与性能。

提出的方法

  • 用功能正则化方法替代目标网络,该方法在训练过程中对Q网络与参考函数的偏差施加惩罚。
  • 使用当前、最新的Q网络参数计算目标Q值,实现新奖励的即时传播。
  • 将正则化形式化为损失函数中的惩罚项,以促进平滑且稳定的更新。
  • 通过约束Q函数的功能形式,隐式稳定学习过程,减少训练过程中的发散。
  • 在特定约束下,证明该正则化方法可泛化并涵盖目标网络作为特例。
  • 该方法端到端应用于深度Q网络,无需架构修改,与标准DQN框架保持兼容。

实验结果

研究问题

  • RQ1功能正则化能否在保持深度Q学习训练稳定性的同时替代目标网络?
  • RQ2使用最新参数进行目标Q值估计是否能带来更快的学习速度和更高的样本效率?
  • RQ3在收敛速度和最终性能方面,功能正则化与目标网络相比如何?
  • RQ4目标网络能否被正式理解为功能正则化的受限特例?
  • RQ5所提出方法是否能在包括Atari和模拟机器人任务在内的多样化环境中泛化?

主要发现

  • 功能正则化通过使用当前网络参数计算目标Q值,避免了目标网络固有的延迟,从而实现更快的训练速度。
  • 在多个Atari环境中,该方法相比使用目标网络的标准DQN展现出更优的样本效率。
  • 实验结果表明,在一系列模拟机器人任务中,该方法在评估指标和学习速度方面均表现更优。
  • 理论分析表明,目标网络是功能正则化的一个特殊且受约束的案例。
  • 该方法无需额外超参数或架构修改即可保持训练稳定性。
  • 在所评估的环境中,功能正则化相比基线方法实现了更快的收敛速度和更优的最终性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。