Skip to main content
QUICK REVIEW

[论文解读] Neural Temporal-Difference and Q-Learning Provably Converge to Global Optima

Qi Cai, Zhuoran Yang|arXiv (Cornell University)|May 24, 2019
Reinforcement Learning in Robotics参考文献 75被引用 15
一句话总结

本文首次证明了神经时间差分(TD)和Q-learning算法在非渐近意义下全局收敛至均方投影贝尔曼误差(MSPBE)目标的全局最优解。通过利用过参数化的深度神经网络,作者建立了次线性收敛速率——使用总体半梯度时为$1/T$,使用随机半梯度时为$1/\big/\text{sqrt}{T}$,从而在非凸性和标准TD学习可能出现发散的情况下,实现了可证明的收敛性。

ABSTRACT

Temporal-difference learning (TD), coupled with neural networks, is among the most fundamental building blocks of deep reinforcement learning. However, due to the nonlinearity in value function approximation, such a coupling leads to nonconvexity and even divergence in optimization. As a result, the global convergence of neural TD remains unclear. In this paper, we prove for the first time that neural TD converges at a sublinear rate to the global optimum of the mean-squared projected Bellman error for policy evaluation. In particular, we show how such global convergence is enabled by the overparametrization of neural networks, which also plays a vital role in the empirical success of neural TD. Beyond policy evaluation, we establish the global convergence of neural (soft) Q-learning, which is further connected to that of policy gradient algorithms.

研究动机与目标

  • 通过严格证明神经TD和Q-learning在实践中取得成功的理论依据,弥合深度强化学习的理论与实践之间的差距。
  • 解决由于非线性函数逼近导致的神经TD学习中非凸性和潜在发散的长期挑战。
  • 建立神经TD和(软)Q-learning在非渐近意义下对MSPBE目标全局最优解的全局收敛性。
  • 通过证明一种策略梯度算法变体的全局收敛性,将神经Q-learning与策略梯度方法联系起来。
  • 证明过参数化可实现隐式局部线性化,从而稳定训练并确保收敛。

提出的方法

  • 利用过参数化的多层神经网络,在优化路径上隐式线性化价值函数,类似于非线性TD中的显式线性化。
  • 使用总体和随机半梯度分析神经TD,证明其收敛至MSPBE目标的全局最优解。
  • 为过参数化网络中的半梯度提出一种单点单调性的概念,使在非凸条件下的收敛性分析成为可能。
  • 采用基于随机特征的近似和浓度不等式,控制与初始化相关的项,并限制与线性化偏差的偏离。
  • 证明在随机初始化下,MSPBE中的投影可实现丰富的函数表示能力,等价于再生核希尔伯特空间。
  • 利用(软)Q-learning与策略梯度算法之间的联系,将全局收敛性扩展至策略优化。

实验结果

研究问题

  • RQ1在非凸性和梯度偏差存在的情况下,神经TD能否可证明地收敛至MSPBE目标的全局最优解?
  • RQ2过参数化在稳定神经TD并实现全局收敛中起到何种作用?
  • RQ3在适当条件下,神经(软)Q-learning是否能全局收敛至最优MSPBE解?
  • RQ4神经Q-learning的全局收敛性能否与策略梯度算法相联系?
  • RQ5过参数化带来的隐式局部线性化如何缓解非线性TD学习中的发散问题?

主要发现

  • 当使用总体半梯度时,神经TD以$1/T$的速率全局收敛至MSPBE的全局最优解。
  • 在使用随机半梯度时,神经TD以$1/\big/\text{sqrt}{T}$的速率收敛,从而在实际在线学习设置下建立了非渐近收敛性。
  • 在更强的正则性条件下,神经(软)Q-learning以与神经TD相同的速率全局收敛至MSPBE最优解。
  • 神经Q-learning的全局收敛性意味着一种策略梯度算法变体的全局收敛性,从而将基于值和基于策略的深度强化学习方法联系起来。
  • 过参数化实现了隐式局部线性化,即使在非线性TD中缺乏显式线性化的情况下,也能避免发散并确保收敛。
  • 在随机初始化下,神经网络的表示能力等价于再生核希尔伯特空间,从而可对一大类强化学习问题实现零MSPBE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。