Skip to main content
QUICK REVIEW

[论文解读] Deep linear neural networks with arbitrary loss: All local minima are global

Thomas Laurent, James von Brecht|arXiv (Cornell University)|Dec 5, 2017
Sparse and Compressive Sensing Techniques参考文献 6被引用 10
一句话总结

该论文证明,对于任意凸可微损失函数的深层线性网络,当最窄的隐藏层宽度至少与输入层或输出层相等时,所有局部最小值均为全局最小值。该证明基于一个简单的矩阵分解方法,利用奇异值分解(SVD)表明,在这些宽度条件下,非全局局部最小值不可能存在;此外,进一步证明了损失函数的可微性是必不可少的条件——不可微的凸损失可能导致次优局部最小值。

ABSTRACT

We consider deep linear networks with arbitrary convex differentiable loss. We provide a short and elementary proof of the fact that all local minima are global minima if the hidden layers are either 1) at least as wide as the input layer, or 2) at least as wide as the output layer. This result is the strongest possible in the following sense: If the loss is convex and Lipschitz but not differentiable then deep linear networks can have sub-optimal local minima.

研究动机与目标

  • 解决深层线性网络中凸可微损失函数下是否存在次优局部最小值的根本性问题。
  • 识别出保证局部最小值为全局最小值的最简结构条件。
  • 证明损失函数的可微性是避免次优局部最小值的必要条件。
  • 提供一个简短且基础的证明,仅使用基本线性代数和奇异值分解(SVD),避免使用复杂的优化理论工具。

提出的方法

  • 将深层线性网络表述为矩阵乘法的复合形式:$\hat{\mathbf{y}}^{(i)} = W_L \cdots W_1 \mathbf{x}^{(i)}$。
  • 将优化问题建模为最小化一个可微凸损失函数 $\mathcal{L}(W_1, \ldots, W_L) = \frac{1}{N}\sum_i \ell(\hat{\mathbf{y}}^{(i)}, \mathbf{y}^{(i)})$。
  • 基于奇异值分解(SVD)的矩阵分解方法,证明任何满足一阶最优性条件的临界点必为全局最优解。
  • 证明:若最窄的隐藏层宽度至少与输入层或输出层相等,则参数化方式可保持实现全局最优所必需的满秩结构。
  • 通过一个不可微凸损失的反例(例如,$f(x,y) = |x| + (1-y)_+ - 1$)表明,当可微性不成立时,次优局部最小值可能产生。
  • 证明:次优局部最小值的缺失关键依赖于候选最小值处梯度的唯一性;对于不可微函数,次梯度可能多值,从而导致优化陷入次优解。

实验结果

研究问题

  • RQ1在何种网络宽度和损失函数条件下,深层线性网络中的所有局部最小值均为全局最小值?
  • RQ2深层线性网络中次优局部最小值的缺失是否依赖于损失函数的可微性?
  • RQ3能否在不依赖高级优化理论的前提下,为深层线性网络中局部最小值的全局最优性构造一个简洁而基础的证明?
  • RQ4当损失函数为凸但不可微时,优化景观会发生什么变化?
  • RQ5最窄隐藏层宽度至少与输入或输出层相等这一宽度条件,是否对局部最小值的全局最优性是必要的?

主要发现

  • 当损失函数为凸且可微,且最窄隐藏层宽度至少与输入层或输出层相等时,深层线性网络中的所有局部最小值均为全局最小值。
  • 该证明简洁且仅依赖于奇异值分解(SVD)和基本矩阵微积分,无需高级优化或线性代数工具,因此易于理解。
  • 该结果是紧致的:若损失函数为凸且Lipschitz连续但不可微,则可能存在次优局部最小值,反例为 $f(x,y) = |x| + (1-y)_+ - 1$。
  • 宽度条件是必要的:若任一隐藏层比输入层和输出层都窄,则参数化无法恢复满秩矩阵,可能导致次优局部最小值出现。
  • 次优局部最小值的缺失关键依赖于临界点处梯度的唯一性;不可微损失函数允许多值次梯度,可能使优化陷入次优解。
  • 该结果可推广至任意可微凸损失函数,而无需对数据或目标秩作假设,这与先前工作不同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。