Skip to main content
QUICK REVIEW

[论文解读] On the Ineffectiveness of Variance Reduced Optimization for Deep Learning

Aaron Defazio, Léon Bottou|arXiv (Cornell University)|Dec 11, 2018
Stochastic Gradient Optimization Techniques参考文献 32被引用 14
一句话总结

本文研究了方差缩减优化方法(特别是 SVRG 和 SAGA)在深度神经网络中的实际有效性,表明尽管在凸设置下具有强大的理论收敛保证,这些方法在大规模非凸深度学习问题中并未提升训练性能。主要发现是,即使采用变换锁定以保持方差缩减,SVRG 在实践中也未能优于标准 SGD,原因在于步长之间的高相关性以及计算开销,尤其是在更深的模型(如 ResNet 和 DenseNet)中。

ABSTRACT

The application of stochastic variance reduction to optimization has shown remarkable recent theoretical and practical success. The applicability of these techniques to the hard non-convex optimization problems encountered during training of modern deep neural networks is an open problem. We show that naive application of the SVRG technique and related approaches fail, and explore why.

研究动机与目标

  • 评估方差缩减优化方法(如 SVRG 和 SAGA)在训练深度神经网络中的实际有效性。
  • 识别为何这些方法在凸设置中表现良好,但在非凸深度学习问题中未能改善收敛性或泛化性能。
  • 研究数据增强和步长相关性对方差缩减及训练动态的影响。
  • 在多个架构和数据集上,比较 SVRG、SAGA 和 SGD 在收敛速度和测试准确率方面的表现。
  • 探索使用 SVRG 进行微调是否能提升最终模型性能,特别是在训练后期。

提出的方法

  • 在 CIFAR-10 和 ImageNet 数据集上,对 LeNet、DenseNet 和 ResNet 架构中的 SVRG 和 SAGA 进行实验评估。
  • 通过缓存快照传递中使用的随机变换,应用变换锁定以在数据增强过程中保持方差缩减。
  • 通过测量每轮训练中梯度更新的方差,量化实际训练中的方差缩减程度。
  • 使用测试误差随轮次的变化比较收敛速度,所有方法保持一致的超参数(学习率、动量)。
  • 在 ImageNet 上对 ResNet-50 和 DenseNet-169 进行消融研究,从不同训练轮次(20、40、60、80)开始 SVRG 微调,以评估后期阶段的收益。
  • 使用流式变体(如 SCSG)并与标准 SVRG 进行比较,评估其性能和稳定性。

实验结果

研究问题

  • RQ1与标准 SGD 相比,通过 SVRG 或 SAGA 实现的方差缩减是否能带来更快的收敛速度或更高的测试准确率?
  • RQ2数据增强(尤其是随机变换)如何影响 SVRG 中方差缩减的有效性?
  • RQ3尽管具有理论优势,连续 SVRG 步长之间的高相关性在多大程度上限制了其实际效益?
  • RQ4使用 SVRG 进行微调是否能提升初始阶段使用 SGD 训练后的最终模型性能?
  • RQ5为何方差缩减方法在 ResNet-110(CIFAR-10)和 ResNet-18(ImageNet)等大模型上仍无法超越 SGD,即使方差被降低?

主要发现

  • 在 ResNet-110(CIFAR-10)和 ResNet-18(ImageNet)等大模型上,SVRG 并未比 SGD 提供更好的收敛性,且由于步长相关性高,通常表现更差。
  • 在较小模型(如 LeNet)上,SVRG 展现出轻微的收敛优势,但该优势随模型规模和复杂度的增加而减弱。
  • 变换锁定显著降低了 SVRG 更新过程中的方差,但这种方差降低并未转化为更快的收敛速度或更高的准确率。
  • SCSG 流式变体的表现劣于 SGD 和 SVRG,表明流式方法无法克服深度学习中方差缩减的根本局限性。
  • 在 ResNet-50 和 DenseNet-169 上,从不同轮次(20–80)开始的 SVRG 微调未能带来优于纯 SGD 的性能提升,即使使用动量。
  • 尽管在凸设置下理论收敛率为线性,但方差缩减方法在非凸深度学习中未能带来实际收益,原因在于高步长相关性和计算开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。