Skip to main content
QUICK REVIEW

[论文解读] When Will Gradient Methods Converge to Max-margin Classifier under ReLU Models?

Tengyu Xu, Yi Zhou|arXiv (Cornell University)|Jun 12, 2018
Stochastic Gradient Optimization Techniques参考文献 20被引用 13
一句话总结

本文研究了在ReLU神经网络中,针对指数损失的二分类任务下,梯度下降(GD)与随机梯度下降(SGD)的隐式偏差。研究发现,由于非凸且非光滑损失曲面中存在虚假渐近局部极小值,GD可能收敛至全局或局部最大间隔方向,或发生发散——这与线性模型中GD始终收敛至全局最大间隔解的情况形成对比。

ABSTRACT

We study the implicit bias of gradient descent methods in solving a binary classification problem over a linearly separable dataset. The classifier is described by a nonlinear ReLU model and the objective function adopts the exponential loss function. We first characterize the landscape of the loss function and show that there can exist spurious asymptotic local minima besides asymptotic global minima. We then show that gradient descent (GD) can converge to either a global or a local max-margin direction, or may diverge from the desired max-margin direction in a general context. For stochastic gradient descent (SGD), we show that it converges in expectation to either the global or the local max-margin direction if SGD converges. We further explore the implicit bias of these algorithms in learning a multi-neuron network under certain stationary conditions, and show that the learned classifier maximizes the margins of each sample pattern partition under the ReLU activation.

研究动机与目标

  • 理解非线性ReLU模型中梯度方法的隐式偏差,此前的研究仅关注线性分类器。
  • 分析在存在非凸与非光滑损失曲面的情况下,ReLU模型中GD与SGD是否收敛至最大间隔方向,尤其是在指数损失下。
  • 建立在有放回随机采样下SGD的逐次迭代收敛性,以扩展先前的训练轮次收敛结果。
  • 研究多神经元ReLU网络中的隐式偏差,表明分类器在每个神经元激活模式划分的样本子集中最大化间隔。
  • 刻画ReLU模型的损失曲面,揭示其存在渐近全局极小值与虚假局部极小值,与线性情况不同。

提出的方法

  • 分析ReLU模型在指数损失下的非凸、非光滑损失曲面,证明渐近全局极小值与虚假局部极小值的存在。
  • 利用渐近分析将GD的收敛行为划分为四类:收敛至全局最大间隔方向、局部最大间隔方向、有限虚假局部极小值,或振荡而不收敛。
  • 应用一种新颖的技术框架,分析SGD在期望下的收敛性,利用指数损失与ReLU激活的结构特性。
  • 提出基于神经元激活的模式划分机制,表明每个划分对应一个最大化间隔的子空间。
  • 推导出权重更新的重参数化形式,以归一化方向表示,从而实现对每个划分中最大间隔方向的收敛性分析。
  • 采用步长变换与递归权重更新分析,表明期望的归一化权重向量以速率 $\mathcal{O}(1/\ln t)$ 收敛至最大间隔方向。

实验结果

研究问题

  • RQ1ReLU模型中的梯度下降是否收敛至最大间隔方向,还是可能被困在虚假局部极小值?
  • RQ2在指数损失下,SGD在有放回随机采样中与GD相比的隐式偏差有何不同?
  • RQ3损失曲面在决定ReLU模型收敛行为方面所起的作用,与线性模型相比如何?
  • RQ4多神经元ReLU网络的隐式偏差是否可被表征为在样本模式划分上最大化间隔?
  • RQ5在何种条件下,SGD在期望下收敛至ReLU模型的全局或局部最大间隔方向?

主要发现

  • ReLU模型在指数损失下的损失曲面是非凸且非光滑的,同时存在渐近全局极小值与虚假局部极小值。
  • 梯度下降可能收敛至全局最大间隔方向、局部最大间隔方向、有限虚假局部极小值,或发生振荡而不收敛。
  • 在有放回随机采样下,若SGD收敛,则其在期望下收敛至全局或局部最大间隔方向。
  • 对于多神经元ReLU网络,学习到的分类器会针对由神经元激活定义的样本模式划分,最大化每个子集的间隔。
  • 在每个划分中,期望的归一化权重向量以速率 $\mathcal{O}(1/\ln t)$ 收敛至最大间隔方向,该结论通过变换步长分析得出。
  • 分析表明,在一个模式划分中,所有神经元对其贡献向量的符号必须相同,且该划分中所有样本必须具有相同标签,从而确保间隔最大化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。