Skip to main content
QUICK REVIEW

[论文解读] Piecewise Strong Convexity of Neural Networks

Tristan Milne|arXiv (Cornell University)|Oct 30, 2018
Stochastic Gradient Optimization Techniques参考文献 21被引用 4
一句话总结

该论文证明了带有权重衰减的ReLU神经网络的正则化损失函数在权重空间的一个重要开集上是分段强凸的,确保该区域内所有可微的临界点均为局部极小值,且局部极小值是孤立的。该结果无需对数据分布做假设,并在图像分类任务上通过实验验证,表明SGD轨迹几乎始终处于分段强凸区域。

ABSTRACT

We study the loss surface of a feed-forward neural network with ReLU non-linearities, regularized with weight decay. We show that the regularized loss function is piecewise strongly convex on an important open set which contains, under some conditions, all of its global minimizers. This is used to prove that local minima of the regularized loss function in this set are isolated, and that every differentiable critical point in this set is a local minimum, partially addressing an open problem given at the Conference on Learning Theory (COLT) 2015; our result is also applied to linear neural networks to show that with weight decay regularization, there are no non-zero critical points in a norm ball obtaining training error below a given threshold. We also include an experimental section where we validate our theoretical work and show that the regularized loss function is almost always piecewise strongly convex when restricted to stochastic gradient descent trajectories for three standard image classification problems.

研究动机与目标

  • 理解带有权重衰减正则化的ReLU神经网络损失曲面的几何性质。
  • 解决COLT 2015提出的关于非凸深度学习优化中临界点性质的开放问题。
  • 建立局部极小值孤立且所有可微临界点均为局部极小值的条件。
  • 通过实证表明SGD轨迹在标准图像分类网络中始终处于分段强凸区域。
  • 通过刻画分段强凸性被保证的集合,为神经网络设计提供指导原则。

提出的方法

  • 通过分析正则化损失函数的Hessian矩阵,基于ReLU激活模式建立分段强凸性。
  • 识别出权重空间中的一个开集——包含原点,并在某些条件下包含所有全局极小值——在此区域内损失函数是分段强凸的。
  • 利用次梯度和二阶分析证明该集合内所有可微临界点均为局部极小值。
  • 将该框架应用于带权重衰减的线性网络,证明在训练误差低于给定阈值的范数球内不存在非零临界点。
  • 通过在MNIST、CIFAR10和CIFAR100上沿SGD轨迹计算归一化二阶导数,对理论进行实证验证。
  • 基于损失值和二阶导数行为,采用基于阈值的准则评估损失函数是否处于分段强凸状态。

实验结果

研究问题

  • RQ1在何种条件下,ReLU神经网络的正则化损失函数是分段强凸的?
  • RQ2在分段强凸区域内,所有可微临界点是否都是局部极小值?
  • RQ3在相同条件下,正则化损失函数的局部极小值是否可以是孤立的?
  • RQ4在实际SGD轨迹上,损失函数是否始终处于分段强凸区域?
  • RQ5在训练误差阈值下,能否严格证明带权重衰减的线性网络中不存在非零临界点?

主要发现

  • 正则化损失函数在包含原点的开集上是分段强凸的,且在特定条件下也包含所有全局极小值。
  • 在此开集内,所有可微临界点均为局部极小值,且局部极小值是孤立的。
  • 对于带权重衰减的线性网络,在训练误差低于给定阈值的范数球内,不存在非零临界点。
  • 实证结果表明,在MNIST、CIFAR10和CIFAR100上,超过95%的SGD轨迹始终处于分段强凸区域,归一化二阶导数持续高于10。
  • 在训练过程的大部分时间里,归一化二阶导数保持较大(通常大于10),表明轨迹上表现出强凸性。
  • 该结果无需对数据分布做假设,因此在现实世界深度学习场景中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。