Skip to main content
QUICK REVIEW

[论文解读] Temporal-difference learning for nonlinear value function approximation in the lazy training regime.

Andréa Agazzi, Jianfeng Lu|arXiv (Cornell University)|Sep 25, 2019
Neural Networks and Applications参考文献 27被引用 6
一句话总结

本文在懒惰训练设定下研究了无限时域折扣马尔可夫决策过程中的非线性值函数逼近,采用时序差分(TD)学习方法,其中模型参数在优化过程中仅发生微小变化。研究证明了在参数量不足和过多的设定下,均能实现向局部或全局最小值点的指数收敛,适用于在非懒惰TD学习下失效的模型和神经网络。

ABSTRACT

We discuss the approximation of the value function for infinite-horizon discounted Markov Decision Processes (MDP) with nonlinear functions trained with Temporal-Difference (TD) learning algorithm. We consider this problem under a certain scaling of the approximating function, leading to a regime called lazy training. In this regime the parameters of the model vary only slightly during the learning process, a feature that has recently been observed in the training of neural networks, where the scaling we study arises naturally, implicit in the initialization of their parameters. Both in the under- and over-parametrized frameworks, we prove exponential convergence to local, respectively global minimizers of the above algorithm in the lazy training regime. We then give examples of such convergence results in the case of models that diverge if trained with non-lazy TD learning, and in the case of neural networks.

研究动机与目标

  • 在懒惰训练设定下,分析使用TD学习的无限时域折扣MDP中的非线性值函数逼近。
  • 建立当模型参数在训练过程中仅发生微小变化时,TD学习的收敛性保证。
  • 在参数量不足和过多的设定下,证明向局部或全局最小值点的指数收敛。
  • 为懒惰训练在神经网络和发散模型中的成功提供理论依据,尤其是在非懒惰TD学习下。
  • 弥合实际深度强化学习训练与非线性函数逼近中理论收敛性之间的差距。

提出的方法

  • 分析在特定缩放下诱导出懒惰训练设定的非线性函数逼近器的TD学习。
  • 将懒惰设定应用于参数量不足和过多的模型,确保训练过程中参数更新量较小。
  • 通过理论分析,证明在参数量不足的情况下向局部最小值点的指数收敛,在参数量过多的情况下向全局最小值点的指数收敛。
  • 基于懒惰缩放下损失曲面的几何结构推导收敛速率。
  • 将该框架应用于神经网络以及在标准TD学习下发散的模型。
  • 依赖从模型初始化中隐式引入的缩放,自然地诱导出懒惰训练设定。

实验结果

研究问题

  • RQ1在懒惰训练设定下,使用非线性函数逼近的TD学习能否实现指数收敛?
  • RQ2懒惰训练设定如何影响参数量不足和过多模型的收敛性?
  • RQ3在懒惰训练下,MDP中的值函数逼近能提供哪些理论保证?
  • RQ4为何某些模型在非懒惰TD学习下发散,但在懒惰设定下收敛?
  • RQ5懒惰设定如何在实践中自然地从神经网络初始化中产生?

主要发现

  • 在参数量不足的懒惰训练设定下,证明了向局部最小值点的指数收敛。
  • 在参数量过多的懒惰训练设定下,建立了向全局最小值点的指数收敛。
  • 懒惰训练设定使原本在标准TD学习下发散的模型实现收敛。
  • 在懒惰设定下训练的神经网络由于参数更新量小,表现出稳定的收敛性。
  • 该理论框架自然地源于标准神经网络初始化,实现了理论与实践的联系。
  • 研究结果为深度强化学习中懒惰训练成功的理论基础提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。