Skip to main content
QUICK REVIEW

[论文解读] Implicit Bias of Gradient Descent for Mean Squared Error Regression with Two-Layer Wide Neural Networks

Hui Jin, Guido Montúfar|arXiv (Cornell University)|Jun 12, 2020
Medical Imaging and Analysis被引用 8
一句话总结

本文证明,在宽的两层ReLU网络上对均方误差回归进行梯度下降时,表现出对平滑函数的隐式偏好,其解紧密逼近插值样条函数。在一元回归中,解收敛至一个最小化加权二阶导数范数的函数,其中权重取决于初始化分布——在均匀初始化下得到自然样条函数,在多元情况下则得到多调和样条函数。

ABSTRACT

We investigate gradient descent training of wide neural networks and the corresponding implicit bias in function space. For univariate regression, we show that the solution of training a width-$n$ shallow ReLU network is within $n^{- 1/2}$ of the function which fits the training data and whose difference from the initial function has the smallest 2-norm of the second derivative weighted by a curvature penalty that depends on the probability distribution that is used to initialize the network parameters. We compute the curvature penalty function explicitly for various common initialization procedures. For instance, asymmetric initialization with a uniform distribution yields a constant curvature penalty, and thence the solution function is the natural cubic spline interpolation of the training data. \hj{For stochastic gradient descent we obtain the same implicit bias result.} We obtain a similar result for different activation functions. For multivariate regression we show an analogous result, whereby the second derivative is replaced by the Radon transform of a fractional Laplacian. For initialization schemes that yield a constant penalty function, the solutions are polyharmonic splines. Moreover, we show that the training trajectories are captured by trajectories of smoothing splines with decreasing regularization strength.

研究动机与目标

  • 表征在过参数化两层ReLU网络中,对均方误差回归进行梯度下降的隐式偏好。
  • 将优化轨迹与最终解与正则化强度递减的平滑样条模型联系起来。
  • 基于初始化分布,推导函数空间中曲率惩罚的显式形式。
  • 通过分数阶拉普拉斯算子与Radon变换,将分析从一元回归推广至多元回归。
  • 证明随机梯度下降与标准梯度下降具有相同的隐式偏好。

提出的方法

  • 在核范式下分析宽网络的梯度流动力学,利用线性化训练动态。
  • 在函数空间中推导一个变分问题,将隐式偏好表征为最小化加权二阶导数(或在多元情况下为分数阶拉普拉斯)的2-范数。
  • 将解表示为正则化强度随时间递减的平滑样条,其与训练轨迹相关联。
  • 对常见初始化方案(如均匀初始化与非对称初始化)显式计算曲率惩罚函数。
  • 利用神经正切核(NTK)框架,将参数空间的优化与函数空间的插值联系起来。
  • 应用核岭回归与样条理论的结果,证明当网络宽度增加且训练进行时,解收敛至插值样条函数。

实验结果

研究问题

  • RQ1在宽的两层ReLU网络中,使用均方误差损失进行训练时,梯度下降如何影响解的偏好?
  • RQ2在一元回归中,隐式偏好的函数形式是什么?其如何依赖于初始化分布?
  • RQ3隐式偏好如何推广至多元回归?分数阶拉普拉斯起什么作用?
  • RQ4训练轨迹能否被描述为一系列正则化强度递减的平滑样条?
  • RQ5在此设置下,随机梯度下降是否表现出与标准梯度下降相同的隐式偏好?

主要发现

  • 在一元回归中,训练函数与最小化加权二阶导数2-范数的插值函数之间的距离在 $ n^{-1/2} $ 以内,其中权重为依赖于初始化分布的曲率惩罚。
  • 在均匀初始化下,曲率惩罚为常数,解收敛至训练数据的自然样条插值函数。
  • 在多元回归中,隐式偏好由分数阶拉普拉斯的Radon变换决定,当惩罚为常数时,解对应于多调和样条函数。
  • 梯度下降的训练轨迹可被良好近似为一系列正则化强度递减的平滑样条。
  • 随机梯度下降产生与标准梯度下降相同的隐式偏好,证实了对优化变体的鲁棒性。
  • 结果可推广至其他激活函数,且在核范式成立的前提下,对优化过程的选择具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。