Skip to main content
QUICK REVIEW

[论文解读] Memorizing Gaussians with no over-parameterizaion via gradient decent on neural networks

Amit Daniely|arXiv (Cornell University)|Mar 28, 2020
Neural Networks and Applications参考文献 21被引用 7
一句话总结

本文证明,在使用正交初始化的深度为两层的ReLU类神经网络上,对d维高斯分布的独立随机标记样本进行单步梯度下降,可实现Ω(dq/log⁴d)个样本的记忆化。该方法在无需过参数化的情况下实现接近最优的记忆化性能,通过梯度更新在激活函数满足轻微条件(如绝对值函数)时增强激活梯度。

ABSTRACT

We prove that a single step of gradient decent over depth two network, with $q$ hidden neurons, starting from orthogonal initialization, can memorize $Ω\left(\frac{dq}{\log^4(d)} ight)$ independent and randomly labeled Gaussians in $\mathbb{R}^d$. The result is valid for a large class of activation functions, which includes the absolute value.

研究动机与目标

  • 解决一个开放问题:在过参数化的网络上,梯度下降是否能以接近最优的参数量记忆随机高斯数据。
  • 证明单步梯度下降足以在高维空间中记忆大量随机标记的高斯分布样本。
  • 在标准正交权重初始化下,对一类广泛激活函数,实现无需过参数化的记忆化。
  • 将先前结果扩展至非标准初始化、特定激活函数或数据分布的限制。

提出的方法

  • 使用具有q个隐藏神经元的深度为两层的ReLU类网络,并采用正交权重初始化。
  • 使用步长η = m ln(d)/d,对缩放后的铰链损失ℓ(ŷ,y) = (ln(d) − ŷy)+执行单步梯度下降。
  • 采用随机初始化方式,其中ai ∈ {±1}且∑ai = O(√q),以高概率成立。
  • 通过初始权重处σ(⟨wi + Δwi, x⟩)的一阶泰勒展开分析网络输出的变化。
  • 利用次高斯和次指数尾部不等式控制激活输出和梯度的偏差。
  • 应用高斯集中性和伯恩斯坦型不等式,控制各神经元σ′(⟨wi, xi⟩)加权和的行为。

实验结果

研究问题

  • RQ1在标准正交初始化下,深度为两层的网络是否能通过单步梯度下降记忆超过线性数量的随机高斯输入?
  • RQ2该方法是否在无需过参数化(即参数量为O(m))的情况下实现近似最优的记忆化?
  • RQ3该结果能否推广至非高斯或结构化数据分布?
  • RQ4该结果对ReLU以外的激活函数(如导数均值不为零的函数)是否具有鲁棒性?
  • RQ5该分析能否扩展至随机梯度下降和更一般的初始化方案?

主要发现

  • 网络以高概率可记忆Ω(dq / log⁴d)个独立采样的、随机标记的d维高斯分布样本。
  • 单步梯度下降后,网络对所有i满足y_i h(W⁺)(x_i) = Ω(ln d),确保了强分类边界。
  • 该结果适用于广泛激活函数类,包括绝对值函数,其满足E[σ′(X)] = 0(当X ~ N(0,1)时)。
  • 分析表明,梯度更新有效放大了预激活值接近零的神经元的贡献,这是由于σ′(·)的非线性特性。
  • 该方法避免了过参数化:参数数量为O(dq),记忆容量为Ω(dq / log⁴d),当m ≈ dq / log⁴d时接近最优。
  • 证明依赖于测度集中性和尾部界,以控制高维各向同性噪声下随机投影和激活梯度的行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。