Skip to main content
QUICK REVIEW

[论文解读] Gradient Descent Finds Global Minima for Generalizable Deep Neural Networks of Practical Sizes

Kenji Kawaguchi, Jiaoyang Huang|arXiv (Cornell University)|Aug 5, 2019
Stochastic Gradient Optimization Techniques参考文献 23被引用 7
一句话总结

该论文证明了梯度下降可在参数量相对于训练样本数量仅线性增长的深度神经网络中找到全局最小值,弥合了理论与实践之间的差距。研究建立表明,大小为 Ω̃(n) 的网络在自然数据集上既可训练也可泛化,且线性缩放率在对数因子范围内为最优。

ABSTRACT

In this paper, we theoretically prove that gradient descent can find a global minimum of non-convex optimization of all layers for nonlinear deep neural networks of sizes commonly encountered in practice. The theory developed in this paper only requires the practical degrees of over-parameterization unlike previous theories. Our theory only requires the number of trainable parameters to increase linearly as the number of training samples increases. This allows the size of the deep neural networks to be consistent with practice and to be several orders of magnitude smaller than that required by the previous theories. Moreover, we prove that the linear increase of the size of the network is the optimal rate and that it cannot be improved, except by a logarithmic factor. Furthermore, deep neural networks with the trainability guarantee are shown to generalize well to unseen test samples with a natural dataset but not a random dataset.

研究动机与目标

  • 为弥合理论可训练性结果与实际深度学习之间的差距,证明梯度下降可在实际规模的网络中找到全局最小值。
  • 建立仅需参数量相对于数据集规模线性增长(Ω̃(n))即可实现可训练性的结论,与以往理论要求多项式或指数增长不同。
  • 证明在自然数据集上,参数量为 Ω̃(n) 的网络可实现良好泛化,但在随机数据集上则不能,从而将可训练性与泛化联系起来。
  • 证明线性缩放率在对数因子范围内为最优,无法进一步改进。
  • 形式化一个‘可能可训练性’框架,以实现未来基于数据和架构的网络可训练性分析。

提出的方法

  • 对具有 ReLU 激活函数和残差连接的深度前馈网络中的梯度下降动力学进行理论分析。
  • 应用 Rademacher 复杂度和集中不等式,对权重范数有界的参数集上的泛化误差进行上界估计。
  • 引入一种参数化方案,通过缩放参数 ς 控制网络权重矩阵的范数,从而在参数类上实现统一的上界。
  • 通过对权重范数离散类(以 k 索引)使用并集界,推导出所有参数配置下的高概率泛化上界。
  • 利用柯西-施瓦茨不等式和詹森不等式,将 Rademacher 复杂度以输入范数和网络深度的形式进行上界估计。
  • 定义可能可训练集 P_{n,H,δ},以形式化在特定数据和架构条件下成功训练的可能性。

实验结果

研究问题

  • RQ1梯度下降是否可在实际规模的深度神经网络中找到全局最小值,即参数量随训练样本数量线性增长?
  • RQ2参数量的线性缩放(Ω̃(n))是否足以保证深度网络的可训练性和泛化能力?
  • RQ3深度网络的可训练性是否依赖于数据分布——具体而言,它们是否在自然数据集上泛化,但在随机数据集上不泛化?
  • RQ4Ω̃(n) 的缩放率是否最优,还是可进一步超越对数因子?
  • RQ5能否构建一个形式化的‘可能可训练性’框架,以统一基于数据和架构的可训练性分析?

主要发现

  • 梯度下降可在仅含 Ω̃(n) 参数的深度神经网络中找到全局最小值,其中 n 为训练样本数量,与实际网络规模一致。
  • 线性缩放率 Ω̃(n) 在对数因子范围内为最优,意味着无法在不引入对数因子减少的情况下进一步改进。
  • 参数量为 Ω̃(n) 的神经网络在 MNIST 和 Fashion-MNIST 等自然数据集上可实现良好泛化,但在随机标签数据上则无法泛化。
  • 理论分析证实,泛化与数据结构相关,因为权重范数的增长与自然数据集和随机数据集之间的泛化差距相关。
  • 泛化误差上界通过 Rademacher 复杂度和集中不等式推导得出,表明以高概率收敛至零训练误差。
  • 可能可训练性框架 P_{n,H,δ} 已形式化,为未来基于数据和架构的可训练性分析提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。