Skip to main content
QUICK REVIEW

[论文解读] Mildly Overparametrized Neural Nets can Memorize Training Data Efficiently

Rong Ge, Runzhe Wang|arXiv (Cornell University)|Sep 26, 2019
Stochastic Gradient Optimization Techniques参考文献 38被引用 14
一句话总结

本文表明,具有多项式激活函数的两层和三层神经网络,仅需比训练样本数量多一个常数因子的参数,即可实现对训练数据的记忆——在适度过参数化下实现完美记忆。通过证明所有局部最小值均为全局最优,该研究展示了扰动梯度下降在隐藏层大小相对于训练样本数为次线性时,仍能收敛至零训练误差。

ABSTRACT

It has been observed \citep{zhang2016understanding} that deep neural networks can memorize: they achieve 100\% accuracy on training data. Recent theoretical results explained such behavior in highly overparametrized regimes, where the number of neurons in each layer is larger than the number of training samples. In this paper, we show that neural networks can be trained to memorize training data perfectly in a mildly overparametrized regime, where the number of parameters is just a constant factor more than the number of training samples, and the number of neurons is much smaller.

研究动机与目标

  • 填补在参数数量仅比训练样本数多一个常数因子的温和过参数化神经网络中,关于记忆机制的理论理解空白。
  • 表明如扰动梯度下降等简单优化算法可在该参数范围内实现完美记忆,与以往工作要求高度过参数化设置相反。
  • 证明当输入处于一般位置时,具有二次激活函数的两层网络和具有多项式激活函数的三层网络,其优化景观中不存在虚假局部最小值。
  • 在平滑分析(输入的随机扰动)和确定性一般位置条件下,均提供理论保证。
  • 证明参数数量与训练样本数量呈线性关系,显著优于以往工作所需的二次或更高阶参数量。

提出的方法

  • 提出使用二次激活函数的两层神经网络,隐藏层大小为 $2d+2$,适用于 $n \leq \binom{d+1}{2}$ 个训练样本。
  • 对中间层权重使用扰动梯度下降(PGD),以确保以高概率收敛至全局最优解并实现零训练误差。
  • 通过证明所有局部最小值均为全局最优,分析优化景观,依赖于变换后数据矩阵的奇异值下界。
  • 引入通过 $r_i \sim \mathcal{N}(0, I)$ 的随机特征映射,将输入数据转换为高阶多项式特征,从而实现网络行为的线性化。
  • 应用矩阵浓度不等式与奇异值分析,界定复合特征矩阵 $(Q \otimes Q)X$ 的最小奇异值,确保在温和条件下可逆。
  • 建立最小奇异值与特征映射范数的概率界,表明以高概率,优化景观保持良好条件。

实验结果

研究问题

  • RQ1仅比训练样本数量多一个常数因子的参数,神经网络是否能记忆任意训练数据?
  • RQ2在隐藏层大小相对于 $n$ 为次线性关系的温和过参数化设置下,扰动梯度下降是否能收敛至零训练误差?
  • RQ3此类网络的优化景观是否可保证不存在虚假局部最小值?
  • RQ4使用多项式激活函数与简单优化算法时,记忆所需的最少参数数量是多少?
  • RQ5输入分布(如扰动后或处于一般位置)如何影响泛化与优化保证?

主要发现

  • 对于 $n \leq \binom{d+1}{2}$ 个处于一般位置的训练样本,使用二次激活函数和 $2d+2$ 个隐藏神经元的两层 ReLU 类似网络,可用 $O(d^2)$ 个参数实现数据记忆。
  • 由于不存在虚假局部最小值,对中间层权重使用扰动梯度下降可高概率收敛至零训练误差。
  • 对于 $n \leq d^p$ 的情况,具有多项式激活函数且每层 $O_p(\sqrt{n})$ 个神经元的三层网络,可记忆任意数据,且参数数量与 $n$ 呈线性关系。
  • 变换后数据矩阵 $(Q \otimes Q)X$ 的最小奇异值以高概率下界为 $\Omega_p(\delta^{2/((\alpha-1)D_d^p)} / k^{(p+1)/(α-1)}) \sigma_{\min}(X)$,确保可逆性。
  • 特征映射的范数以 $\sqrt{k}(2B\sqrt{d\ln(kd\delta^{-1/2})})^p$ 上界限定,确保优化过程中的稳定性。
  • 在扰动半径为 $\sqrt{v}$ 的平滑分析下,结果成立,且保证依赖于 $v$ 的逆多项式,与网络规模无关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。