Skip to main content
QUICK REVIEW

[论文解读] Proximal Backpropagation

Thomas Frerix, Thomas Möllenhoff|arXiv (Cornell University)|Jun 14, 2017
Stochastic Gradient Optimization Techniques参考文献 16被引用 9
一句话总结

该论文提出了一种新型训练算法——近端反向传播(Proximal Backpropagation, ProxProp),通过用隐式(近端)步骤替代反向传播中的显式梯度步骤,提升优化的稳定性和收敛性。通过将反向传播重新解释为对耦合网络激活的二次惩罚能量的序列最小化,ProxProp即使在近似求解下也能保证下降方向,从而在各种步长下实现稳定训练,并在与Adam结合时,尤其在泛化能力和损失收敛方面优于标准反向传播。

ABSTRACT

We propose proximal backpropagation (ProxProp) as a novel algorithm that takes implicit instead of explicit gradient steps to update the network parameters during neural network training. Our algorithm is motivated by the step size limitation of explicit gradient descent, which poses an impediment for optimization. ProxProp is developed from a general point of view on the backpropagation algorithm, currently the most common technique to train neural networks via stochastic gradient descent and variants thereof. Specifically, we show that backpropagation of a prediction error is equivalent to sequential gradient descent steps on a quadratic penalty energy, which comprises the network activations as variables of the optimization. We further analyze theoretical properties of ProxProp and in particular prove that the algorithm yields a descent direction in parameter space and can therefore be combined with a wide variety of convergent algorithms. Finally, we devise an efficient numerical implementation that integrates well with popular deep learning frameworks. We conclude by demonstrating promising numerical results and show that ProxProp can be effectively combined with common first order optimizers such as Adam.

研究动机与目标

  • 解决标准反向传播在深度学习优化中存在不稳定性和步长敏感性的问题。
  • 通过约束优化的视角重新诠释反向传播,开发一种更鲁棒的训练算法。
  • 证明隐式梯度步骤(近端更新)在参数空间中能产生下降方向,从而在弱假设下确保收敛。
  • 设计一种高效且与框架兼容的实现,利用无矩阵共轭梯度近似。
  • 通过实验验证ProxProp在训练稳定性、收敛速度和泛化能力方面优于标准反向传播。

提出的方法

  • 将反向传播重新表述为在耦合网络激活的二次惩罚能量上交替进行前向传播和序列梯度下降。
  • 用参数空间上的隐式(近端)更新替代显式梯度更新,其定义基于最小化正则化二次逼近的近端算子。
  • 使用无矩阵共轭梯度(CG)迭代高效近似隐式步骤,重用深度学习框架中已有的前向和反向操作。
  • 证明精确和CG近似近端步骤均能在参数空间中产生下降方向,从而可与收敛的一阶优化器集成。
  • 将ProxProp作为可微的Oracle模块集成到标准优化器(如Adam)中,替代梯度计算步骤。
  • 采用惩罚参数τ控制隐式步骤大小,在广泛的τ值范围内均表现出稳定性。

实验结果

研究问题

  • RQ1能否将反向传播重新诠释为涉及网络激活的二次惩罚能量的序列最小化?
  • RQ2在反向传播中,用隐式(近端)步骤替代显式梯度步骤是否能在参数空间中产生下降方向?
  • RQ3近端步骤的无矩阵共轭梯度近似是否能保持下降性质和收敛保证?
  • RQ4与标准反向传播相比,ProxProp是否能提升训练稳定性与泛化能力,尤其是在大步长或病态条件步长下?
  • RQ5ProxProp是否能与Adam等一阶优化器有效结合,以加速收敛并提升测试准确率?

主要发现

  • ProxProp在广泛的步长τ范围内保持稳定,即使在τ = 5×10⁻⁴时也未出现发散,而标准反向传播在τ = 0.05时已发散。
  • 与Adam结合时,ProxProp(使用3次CG迭代)在CIFAR-10数据集上经50个周期训练后达到更高的验证准确率(72.9%),优于标准反向传播的71.7%。
  • 经50个周期训练后,ProxProp的测试集准确率(70.7%)高于标准反向传播(69.6%),表明其泛化能力更强。
  • 如图3所示,无论基于周期还是时间的训练曲线,使用3次CG迭代的ProxProp均比标准反向传播更快降低全批量损失。
  • CG对近端步骤的近似能保持下降性质,理论证明与数值验证均表明其成立,从而支持高效实现。
  • ProxProp即使在大步长下也能实现稳定训练,表明其可缓解SGD和Adam中常见的学习率精细调优需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。