[论文解读] Neural Networks Learning and Memorization with (almost) no Over-Parameterization
该论文表明,两层 ReLU 神经网络上的随机梯度下降(SGD)可以记忆随机标签数据,学习有界次数的多项式,并使用接近最优的网络规模近似核方法——具体而言,在单位球面 $\sigma^{d-1}$ 上对 $m$ 个样本,使用 $\tilde{O}(m)$ 个参数,通过 $\tilde{O}(m/\epsilon^2)$ 次 SGD 步骤实现对 $1-\epsilon$ 比例数据的记忆。关键贡献在于,无需过度参数化,即可实现接近最优的样本量、参数量和运行时间复杂度。
Many results in recent years established polynomial time learnability of various models via neural networks algorithms. However, unless the model is linear separable, or the activation is a polynomial, these results require very large networks -- much more than what is needed for the mere existence of a good predictor. In this paper we prove that SGD on depth two neural networks can memorize samples, learn polynomials with bounded weights, and learn certain kernel spaces, with near optimal network size, sample complexity, and runtime. In particular, we show that SGD on depth two network with $ ilde{O}\left(\frac{m}{d} ight)$ hidden neurons (and hence $ ilde{O}(m)$ parameters) can memorize $m$ random labeled points in $\mathbb{S}^{d-1}$.
研究动机与目标
- 通过避免过度参数化,弥合深度学习中理论可学习性与实际网络规模之间的差距。
- 证明两层网络上的 SGD 可以使用接近最优的参数量记忆随机数据。
- 证明在有界数据分布下,多项式与核空间可使用最小网络规模被学习。
- 建立标准激活函数(如 ReLU)与铰链损失可实现高效学习,而无需使用 $m^2$ 个参数。
提出的方法
- 分析具有 $2q$ 个隐层神经元的两层 ReLU 网络上的 SGD 训练,采用一种新型权重初始化:$W$ 为标准高斯分布的复制,$\mathbf{u}$ 为大常数 $B$ 及其相反数的复制。
- 将学习问题简化为向量随机特征方案,通过浓度与反浓度不等式进行分析。
- 引入 $\mathbb{S}^{d-1}$ 上的 $R$-有界分布概念,其中 $\mathbb{E}_\mathbf{x} \langle \mathbf{u}, \mathbf{x} \rangle^2 \leq R^2/d$,以控制泛化性与泛化误差。
- 利用埃尔米特多项式展开与对偶激活函数,将网络输出与核空间及多项式逼近联系起来。
- 应用高概率浓度不等式与联合界,以界定网络输出与目标函数之间的偏差。
- 证明对于 $O(1)$-有界分布,SGD 以高概率实现 $O\left(\sqrt{\frac{m \log^{c'+2}(m/\delta)}{dq}}\right)$ 的泛化误差。
实验结果
研究问题
- RQ1两层 ReLU 网络上的 SGD 是否能使用仅 $\tilde{O}(m)$ 个参数,在 $\mathbb{S}^{d-1}$ 上记忆 $m$ 个随机标签点?
- RQ2对于 $O(1)$-有界分布,SGD 学习有界次数多项式所需的最小网络规模是多少?
- RQ3能否使用两层网络上的 SGD,以接近最优的参数量与运行时间,学习核空间?
- RQ4数据分布的有界性如何影响此设置下 SGD 的泛化性与样本复杂度?
- RQ5所提出的初始化方案是否能实现记忆化与学习任务的近似最优收敛?
主要发现
- 使用 $\tilde{O}(m)$ 个参数的两层 ReLU 网络上的 SGD,可通过 $\tilde{O}(m/\epsilon^2)$ 次 SGD 步骤,在 $\mathbb{S}^{d-1}$ 上记忆 $m$ 个随机标签点中占 $1-\epsilon$ 比例的数据。
- 对于 $O(1)$-有界分布,SGD 可以使用 $\tilde{O}(M^2)$ 个参数与 $\tilde{O}(m/\epsilon^2)$ 次步骤,学习次数 $\leq c$ 且系数范数 $\leq M$ 的偶多项式类。
- 当 $m = d^c$ 且隐层神经元数为 $q$ 时,网络以高概率实现 $O\left(\sqrt{\frac{m \log^{c'+2}(m/\delta)}{dq}}\right)$ 的泛化误差。
- 球面上的均匀分布、离散立方体 $\{\pm 1/\sqrt{d}\}^d$,以及满足 $m = \omega(d)$ 的随机点集,均属于 $O(1)$-有界分布,使得结果可适用于自然数据分布。
- 对于 $R$-有界分布,参数量为 $O(1)$-有界情况下的 $O(R^2)$ 倍,但运行时间仍保持为 $\tilde{O}(m/\epsilon^2)$。
- 分析表明,过度参数化并非记忆化或学习的必要条件:接近最优的网络规模已足以使 SGD 成功。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。