Skip to main content
QUICK REVIEW

[论文解读] A Generalized Neural Tangent Kernel Analysis for Two-layer Neural Networks

Zixiang Chen, Yuan Cao|arXiv (Cornell University)|Feb 10, 2020
Neural Networks and Applications参考文献 63被引用 16
一句话总结

该论文将神经正切核(NTK)框架扩展至采用噪声梯度下降和权重衰减训练的两层神经网络,证明此类正则化训练仍表现出类似核的动态特性。作者建立了向近似最优解的线性收敛性,并基于初始化分布的χ²散度推导出泛化误差界,克服了先前NTK理论中假设权重始终保持在初始化附近这一局限。

ABSTRACT

A recent breakthrough in deep learning theory shows that the training of over-parameterized deep neural networks can be characterized by a kernel function called extit{neural tangent kernel} (NTK). However, it is known that this type of results does not perfectly match the practice, as NTK-based analysis requires the network weights to stay very close to their initialization throughout training, and cannot handle regularizers or gradient noises. In this paper, we provide a generalized neural tangent kernel analysis and show that noisy gradient descent with weight decay can still exhibit a "kernel-like" behavior. This implies that the training loss converges linearly up to a certain accuracy. We also establish a novel generalization error bound for two-layer neural networks trained by noisy gradient descent with weight decay.

研究动机与目标

  • 为解决标准NTK理论的局限性,该理论假设网络权重始终靠近初始化,无法处理正则化项或梯度噪声。
  • 将NTK框架扩展至包含权重衰减和噪声梯度下降的更现实训练设置。
  • 为过参数化的两层神经网络在这些正则化设置下建立理论保证——特别是线性收敛性和泛化误差界。
  • 通过关注平均场极限下的分布接近性,放宽对参数与初始化接近性的要求。

提出的方法

  • 使用平均场分析来建模两层神经网络在训练过程中参数分布的演化。
  • 通过分析带有权重衰减的噪声梯度下降所决定的参数分布的连续时间Fokker-Planck方程,引入广义神经正切核。
  • 推导出演化参数分布与初始分布之间KL散度的微分方程,证明在适当条件下该散度会减小。
  • 将Meir和Zhang(2003)的证明技术从离散分布推广至连续分布,以推导泛化误差界。
  • 通过分析平均场状态下类似核的行为动态,证明训练损失可线性收敛至某一精度。
  • 使用χ²散度表征在权重衰减和噪声下,无限宽网络可学习的函数类,从而在泛化误差界中显式体现正则化作用。

实验结果

研究问题

  • RQ1神经正切核框架能否扩展至权重衰减和梯度噪声的设置,其中参数远离初始化?
  • RQ2在过参数化的两层神经网络中,带有权重衰减的噪声梯度下降是否仍表现出类似核的训练动态?
  • RQ3对于采用权重衰减和噪声训练的两层网络,能否推导出超越标准NTK范式的泛化误差界?
  • RQ4能否在平均场极限下,以分布接近性替代对参数与初始化接近性的要求?
  • RQ5使用初始化分布的χ²散度来表征正则化下的泛化能力,对宽网络的泛化性能有何影响?

主要发现

  • 即使网络参数显著偏离初始化,带有权重衰减的噪声梯度下降仍可实现训练损失的线性收敛,直至某一精度。
  • 泛化误差界以最终参数分布与初始化分布之间的χ²散度表示,从而显式处理了正则化影响。
  • 所提出的分析通过关注分布稳定性而非参数接近性,克服了参数漂移带来的技术障碍。
  • 与标准NTK界相比,该泛化界更紧致且更符合实际,因其显式考虑了如权重衰减等正则化项。
  • 该证明技术将Meir和Zhang(2003)的方法从离散分布推广至连续分布,可能在统计学习理论中具有独立兴趣。
  • 理论结果在连续时间极限下得到验证,并通过Mei等人(2018)的近似结果扩展至离散时间设置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。