[论文解读] Neural Temporal-Difference and Q-Learning Provably Converge to Global Optima
本文首次证明了神经时间差分(TD)和Q-learning算法在非渐近意义下全局收敛至均方投影贝尔曼误差(MSPBE)目标的全局最优解。通过利用过参数化的深度神经网络,作者建立了次线性收敛速率——使用总体半梯度时为$1/T$,使用随机半梯度时为$1/\big/\text{sqrt}{T}$,从而在非凸性和标准TD学习可能出现发散的情况下,实现了可证明的收敛性。
Temporal-difference learning (TD), coupled with neural networks, is among the most fundamental building blocks of deep reinforcement learning. However, due to the nonlinearity in value function approximation, such a coupling leads to nonconvexity and even divergence in optimization. As a result, the global convergence of neural TD remains unclear. In this paper, we prove for the first time that neural TD converges at a sublinear rate to the global optimum of the mean-squared projected Bellman error for policy evaluation. In particular, we show how such global convergence is enabled by the overparametrization of neural networks, which also plays a vital role in the empirical success of neural TD. Beyond policy evaluation, we establish the global convergence of neural (soft) Q-learning, which is further connected to that of policy gradient algorithms.
研究动机与目标
- 通过严格证明神经TD和Q-learning在实践中取得成功的理论依据,弥合深度强化学习的理论与实践之间的差距。
- 解决由于非线性函数逼近导致的神经TD学习中非凸性和潜在发散的长期挑战。
- 建立神经TD和(软)Q-learning在非渐近意义下对MSPBE目标全局最优解的全局收敛性。
- 通过证明一种策略梯度算法变体的全局收敛性,将神经Q-learning与策略梯度方法联系起来。
- 证明过参数化可实现隐式局部线性化,从而稳定训练并确保收敛。
提出的方法
- 利用过参数化的多层神经网络,在优化路径上隐式线性化价值函数,类似于非线性TD中的显式线性化。
- 使用总体和随机半梯度分析神经TD,证明其收敛至MSPBE目标的全局最优解。
- 为过参数化网络中的半梯度提出一种单点单调性的概念,使在非凸条件下的收敛性分析成为可能。
- 采用基于随机特征的近似和浓度不等式,控制与初始化相关的项,并限制与线性化偏差的偏离。
- 证明在随机初始化下,MSPBE中的投影可实现丰富的函数表示能力,等价于再生核希尔伯特空间。
- 利用(软)Q-learning与策略梯度算法之间的联系,将全局收敛性扩展至策略优化。
实验结果
研究问题
- RQ1在非凸性和梯度偏差存在的情况下,神经TD能否可证明地收敛至MSPBE目标的全局最优解?
- RQ2过参数化在稳定神经TD并实现全局收敛中起到何种作用?
- RQ3在适当条件下,神经(软)Q-learning是否能全局收敛至最优MSPBE解?
- RQ4神经Q-learning的全局收敛性能否与策略梯度算法相联系?
- RQ5过参数化带来的隐式局部线性化如何缓解非线性TD学习中的发散问题?
主要发现
- 当使用总体半梯度时,神经TD以$1/T$的速率全局收敛至MSPBE的全局最优解。
- 在使用随机半梯度时,神经TD以$1/\big/\text{sqrt}{T}$的速率收敛,从而在实际在线学习设置下建立了非渐近收敛性。
- 在更强的正则性条件下,神经(软)Q-learning以与神经TD相同的速率全局收敛至MSPBE最优解。
- 神经Q-learning的全局收敛性意味着一种策略梯度算法变体的全局收敛性,从而将基于值和基于策略的深度强化学习方法联系起来。
- 过参数化实现了隐式局部线性化,即使在非线性TD中缺乏显式线性化的情况下,也能避免发散并确保收敛。
- 在随机初始化下,神经网络的表示能力等价于再生核希尔伯特空间,从而可对一大类强化学习问题实现零MSPBE。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。