Skip to main content
QUICK REVIEW

[论文解读] When does gradient descent with logistic loss interpolate using deep networks with smoothed ReLU activations?

Niladri S. Chatterji, Philip M. Long|arXiv (Cornell University)|Feb 9, 2021
Stochastic Gradient Optimization Techniques参考文献 66被引用 5
一句话总结

该论文建立了在使用 Swish 和 Huberized ReLU 等平滑激活函数的深层 ReLU 网络中,梯度下降配合逻辑斯蒂损失使训练损失趋近于零的条件。论文证明了在两个充分条件下的收敛性:(1) 初始损失较小,(2) 在初始化时通过神经正切特征实现数据可分性,收敛速率通过梯度对齐和损失光滑性分析推导得出。

ABSTRACT

We establish conditions under which gradient descent applied to fixed-width deep networks drives the logistic loss to zero, and prove bounds on the rate of convergence. Our analysis applies for smoothed approximations to the ReLU, such as Swish and the Huberized ReLU, proposed in previous applied work. We provide two sufficient conditions for convergence. The first is simply a bound on the loss at initialization. The second is a data separation condition used in prior analyses.

研究动机与目标

  • 理解在使用平滑 ReLU 激活函数的深层网络中,梯度下降配合逻辑斯蒂损失在何种条件下可实现零训练损失。
  • 识别确保零损失收敛的充分条件,特别是初始损失大小或数据可分性。
  • 将先前针对两层网络的研究结果推广至使用平滑 ReLU 近似函数的深层架构。
  • 克服神经正切核(NTK)框架的局限性,该框架在固定宽度网络中失效,原因在于逻辑斯蒂损失下参数轨迹无界。

提出的方法

  • 使用 Swish 和 Huberized ReLU 等平滑 ReLU 激活函数分析梯度下降的动力学。
  • 证明当初始损失较小时,负梯度与网络权重对齐,从而在每一步中确保梯度范数的下界。
  • 利用梯度步长邻域内的损失光滑性,表明小步长可确保每一步中损失单调下降。
  • 应用神经正切核(NTK)分析,表明在数据可分性条件下,早期训练中损失可充分减小。
  • 将 [ALS19, Zou+20] 的先前结果适配至平滑 ReLU 设置,调整证明以考虑非 ReLU 激活函数的特性。
  • 采用概率工具,包括次高斯和次指数尾部浓度不等式,并为稀疏向量构造 ε-网,以控制泛化误差界。

实验结果

研究问题

  • RQ1在使用平滑 ReLU 激活函数的固定宽度深层网络中,梯度下降配合逻辑斯蒂损失在何种条件下收敛至零训练损失?
  • RQ2当初始损失较小时,负梯度与网络权重之间的对齐如何促进收敛?
  • RQ3在标准 NTK 分析因参数移动无界而失效的情况下,是否可将收敛保证推广至使用平滑 ReLU 近似函数的深层网络?
  • RQ4若初始化时的特征能以一定裕量分离数据(即数据可分性条件),是否足以确保早期训练阶段损失衰减?
  • RQ5在所提出的条件下,收敛速率如何依赖于初始损失和网络宽度?

主要发现

  • 在使用平滑 ReLU 激活函数时,无论网络宽度如何,只要初始损失较小,梯度下降即可使逻辑斯蒂损失趋近于零。
  • 关键机制在于每一步开始时负梯度与网络权重的对齐,这确保了梯度范数的下界,从而实现损失下降。
  • 在每一步梯度步长初始点邻域内的损失光滑性,确保了小步长可实现每一步中的一致损失减少。
  • 在数据可分性条件下(即初始化时的神经正切特征能以裕量分离数据),早期迭代中损失可充分减小,从而触发第一个收敛条件。
  • 该分析将先前针对两层网络使用 Huberized ReLU 的结果推广至深层架构,在弱于要求正齐次性和光滑性的假设下实现。
  • 结果对实际中广泛使用的激活函数(如 Swish 和 Huberized ReLU)具有鲁棒性,这些函数因非光滑性或非齐次性而被先前的理论分析所排除。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。