Skip to main content
QUICK REVIEW

[论文解读] Limitations of Lazy Training of Two-layers Neural Networks

Behrooz Ghorbani, Mei Song|arXiv (Cornell University)|Jun 21, 2019
Neural Networks and Applications参考文献 28被引用 11
一句话总结

本文研究了在两层ReLU神经网络中,当激活函数为二次函数时,懒训练(lazy training)的局限性,比较了随机特征(RF)、神经正切(NT)和完全训练(NN)三种训练范式。研究证明,当神经元数量小于输入维度时,即使对于简单的二次函数,RF与NT范式下的泛化风险也可能远差于完全训练范式,凸显了在低过参数化设置下懒学习性能的根本性差距。

ABSTRACT

We study the supervised learning problem under either of the following two models: (1) Feature vectors ${\boldsymbol x}_i$ are $d$-dimensional Gaussians and responses are $y_i = f_*({\boldsymbol x}_i)$ for $f_*$ an unknown quadratic function; (2) Feature vectors ${\boldsymbol x}_i$ are distributed as a mixture of two $d$-dimensional centered Gaussians, and $y_i$'s are the corresponding class labels. We use two-layers neural networks with quadratic activations, and compare three different learning regimes: the random features (RF) regime in which we only train the second-layer weights; the neural tangent (NT) regime in which we train a linearization of the neural network around its initialization; the fully trained neural network (NN) regime in which we train all the weights in the network. We prove that, even for the simple quadratic model of point (1), there is a potentially unbounded gap between the prediction risk achieved in these three training regimes, when the number of neurons is smaller than the ambient dimension. When the number of neurons is larger than the number of dimensions, the problem is significantly easier and both NT and NN learning achieve zero risk.

研究动机与目标

  • 分析在三种训练范式(随机特征RF、神经正切NT、完全训练NN)下,两层神经网络的泛化性能。
  • 探究懒训练(NT)与随机特征(RF)是否能有效近似那些需要完整网络训练才能实现的函数,尤其是在低过参数化设置下。
  • 识别NT与RF范式在何种条件下无法实现最优风险,即使对于简单的目标函数(如二次型)亦然。
  • 建立三种范式之间预测风险差距的理论边界,尤其关注神经元数量小于输入维度的情形。

提出的方法

  • 分析两类监督学习问题:(1) 使用高斯特征的回归任务与二次目标函数;(2) 使用高斯混合特征与类别标签的二分类任务。
  • 在二次激活函数下,比较三种训练范式:RF(仅训练第二层权重)、NT(在初始化处线性化)与NN(所有权重均训练)。
  • 利用泛函分析与矩阵优化,推导每种范式下的精确预测风险表达式,特别关注核矩阵的Frobenius范数与迹。
  • 通过目标函数Hessian矩阵与数据协方差矩阵的特征分解,刻画最优网络权重并最小化风险。
  • 应用柯西-施瓦茨不等式以界定NN范式下的风险,并将最优解表示为对目标矩阵的前r个奇异子空间的投影。
  • 建立结论:NN范式下的最优风险由目标矩阵Δ的前r个最大奇异值的平方和决定,其中r为神经元数量与输入维度的最小值。

实验结果

研究问题

  • RQ1对于简单的二次目标函数,随机特征(RF)与神经正切(NT)范式能否达到与完全训练(NN)范式相同的泛化风险?
  • RQ2当神经元数量小于输入维度时,RF、NT与NN范式之间的预测风险是否存在根本性差距?
  • RQ3在何种条件下,懒训练无法捕捉到完全训练的两层网络的表达能力?
  • RQ4神经元数量与输入维度之间的关系如何影响三种训练范式下的风险?
  • RQ5在两层ReLU网络中,当激活函数为二次函数时,懒训练与完全训练之间是否存在可证明的、可能无界的性能差距?

主要发现

  • 当神经元数量小于输入维度时,即使对于简单的二次目标函数,RF与NT范式下的预测风险也可能无界地劣于完全训练的NN范式。
  • 对于相同的二次目标函数,当神经元数量小于输入维度时,NT范式下的风险被下界远离零,而NN范式在神经元数量超过维度时可实现零风险。
  • 当神经元数量大于输入维度时,NT与NN范式均能实现零预测风险,表明过参数化可弥合懒训练与完全训练之间的差距。
  • NN范式下的最优风险由目标矩阵Δ的前r个最大奇异值的平方和决定,其中r为神经元数量与输入维度的最小值。
  • 当神经元数量较小时,RF与NT范式由于其线性化特性与固定的第一层权重,根本上限制了其对二次函数的表示能力。
  • 本文建立了全训练与懒训练之间表达能力的理论分离,表明懒学习无法始终高效近似那些全训练网络可轻松表示的函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。