Skip to main content
QUICK REVIEW

[论文解读] Breaking the Deadly Triad with a Target Network

Shangtong Zhang, Hengshuai Yao|arXiv (Cornell University)|Jan 21, 2021
Reinforcement Learning in Robotics参考文献 59被引用 5
一句话总结

本文提出了一种新颖的目标网络更新规则,通过两次投影来稳定函数逼近与自举法结合的离策略强化学习——即所谓的“致命三联组”('deadly triad')。通过将目标网络与岭正则化相结合,作者在策略评估与控制设置下证明了对正则化TD不动点的收敛性,首次在非限制性、变化的行为策略下实现了无需双层优化的收敛线性Q-learning算法。

ABSTRACT

The deadly triad refers to the instability of a reinforcement learning algorithm when it employs off-policy learning, function approximation, and bootstrapping simultaneously. In this paper, we investigate the target network as a tool for breaking the deadly triad, providing theoretical support for the conventional wisdom that a target network stabilizes training. We first propose and analyze a novel target network update rule which augments the commonly used Polyak-averaging style update with two projections. We then apply the target network and ridge regularization in several divergent algorithms and show their convergence to regularized TD fixed points. Those algorithms are off-policy with linear function approximation and bootstrapping, spanning both policy evaluation and control, as well as both discounted and average-reward settings. In particular, we provide the first convergent linear $Q$-learning algorithms under nonrestrictive and changing behavior policies without bi-level optimization.

研究动机与目标

  • 解决在结合函数逼近、自举法与离策略学习时,离策略强化学习的不稳定性问题——即所谓的‘致命三联组’。
  • 为深度强化学习算法(如DQN)中目标网络的实证成功提供理论依据。
  • 提出一种新的目标网络更新规则,确保在一般离策略设置下的收敛性。
  • 在折扣奖励与平均奖励设置下,建立具有线性函数逼近的离策略算法向正则化TD不动点收敛的理论基础。
  • 在非限制性且变化的行为策略下,首次提出无需双层优化的收敛线性Q-learning算法。

提出的方法

  • 提出一种新颖的目标网络更新规则,通过在Polyak平均基础上引入两次投影,以改善理论分析与收敛性保证。
  • 采用双时间尺度框架,使主网络更新速度高于目标网络,从而将更新过程转化为最小二乘回归问题。
  • 对最小二乘问题应用岭正则化,以确保稳定性和收敛性。
  • 分析在策略评估与控制任务中向正则化TD不动点的收敛性。
  • 将该方法应用于折扣奖励与平均奖励的MDP,覆盖广泛的离策略算法。
  • 采用基于投影的更新机制,以控制目标网络的轨迹,确保有界性与理论可处理性。

实验结果

研究问题

  • RQ1具有新颖更新规则的目标网络能否稳定函数逼近与自举法结合的离策略强化学习?
  • RQ2所提出的目標网络更新规则是否能在一般离策略设置下确保收敛至正则化TD不动点?
  • RQ3在线性Q-learning中,能否在非限制性且变化的行为策略下实现收敛,而无需双层优化?
  • RQ4目标网络通过何种理论机制在‘致命三联组’存在时稳定学习过程?
  • RQ5目标网络更新中的投影机制如何改善收敛性分析与稳定性?

主要发现

  • 所提出的具有两次投影的目标网络更新规则,确保了在策略评估与控制任务中向正则化TD不动点的收敛。
  • 该方法在非限制性且变化的行为策略下实现了离策略线性Q-learning的收敛,而此前的方法在该设置下常出现发散。
  • 算法无需双层优化即可收敛,相较于先前方法更具实用性与效率。
  • 理论分析表明,目标网络通过将自举更新转化为正则化最小二乘回归,从而稳定学习过程。
  • 在Baird与Kolter示例上的实证验证表明,该方法可避免标准离策略TD与Q-learning的发散问题。
  • 收敛性在折扣奖励与平均奖励设置下均得到证明,显著拓宽了该方法的适用范围。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。