Skip to main content
QUICK REVIEW

[论文解读] Adapting Resilient Propagation for Deep Learning

Alan Mosca, George D. Magoulas|arXiv (Cornell University)|Sep 15, 2015
Domain Adaptation and Few-Shot Learning参考文献 10被引用 13
一句话总结

本文提出了一种改进的 Rprop 算法,通过引入对 dropout 的感知能力,解决了深度神经网络中的零梯度问题,显著提升了训练速度与准确率。该方法仅用 35 个周期就在 MNIST 上实现了 2.57% 的验证误差,快于标准 SGD 和未经修改的 Rprop,同时实现了在普通硬件上高效训练深度神经网络集成模型。

ABSTRACT

The Resilient Propagation (Rprop) algorithm has been very popular for backpropagation training of multilayer feed-forward neural networks in various applications. The standard Rprop however encounters difficulties in the context of deep neural networks as typically happens with gradient-based learning algorithms. In this paper, we propose a modification of the Rprop that combines standard Rprop steps with a special drop out technique. We apply the method for training Deep Neural Networks as standalone components and in ensemble formulations. Results on the MNIST dataset show that the proposed modification alleviates standard Rprop's problems demonstrating improved learning speed and accuracy.

研究动机与目标

  • 为解决标准 Rprop 与 dropout 在深度神经网络中不兼容的问题,其中 dropout 引发的零梯度会破坏 Rprop 的学习动态。
  • 通过使 Rprop 能够区分真实的梯度符号变化与由 dropout 引起的零梯度,提升其在深度学习中的收敛速度与最终准确率。
  • 通过利用改进后的 Rprop 算法的更快收敛特性,实现深度神经网络集成模型的快速训练。
  • 证明改进后的 Rprop 在 MNIST 基准测试中,无论是速度还是准确率,均优于标准 SGD 和未经修改的 Rprop。

提出的方法

  • 改进的 Rprop 算法通过跟踪 dropout 掩码 $Dm$,以区分由 dropout 引起的零梯度与表示梯度符号变化的零梯度。
  • 当零梯度由 dropout 导致时,该算法避免跳过权重和学习率更新,而标准 Rprop 会将所有零梯度一视同仁处理。
  • 该算法保持了 Rprop 核心机制:基于梯度符号一致性,通过乘法因子 $\eta_+$ 和 $\eta_-$ 自适应调整步长。
  • 改进的 Rprop 被用于训练单个深度神经网络,并集成到使用装袋法(bagging)和堆叠法(stacking)的集成框架中。
  • 集成训练使用改进的 Rprop 快速训练基模型 DNN,随后使用第二个空间分类器(另一个 DNN)来融合预测结果。
  • 该方法采用一种改进的权重更新规则,在决定是否跳过更新前检查 dropout 掩码,从而在 dropout 阶段仍能保持学习进度。

实验结果

研究问题

  • RQ1当与 dropout 正则化结合时,Rprop 是否能被有效适配用于深度神经网络的训练?
  • RQ2由 dropout 引发的零梯度是否阻碍标准 Rprop 的收敛?如果是,应如何缓解?
  • RQ3改进的 Rprop 算法是否能在深度学习任务中实现比标准 SGD 和未经修改的 Rprop 更快的收敛速度与更好的泛化能力?
  • RQ4改进 Rprop 的训练速度提升是否足以实现在标准台式机硬件上实用化训练深度神经网络集成模型?

主要发现

  • 改进的 Rprop 在 MNIST 数据集上实现了最低 2.57% 的验证误差,优于标准 SGD(2.85%)和未经修改的 Rprop(3.03%)。
  • 改进的 Rprop 仅用 35 个周期就达到最佳性能,而未经修改的 Rprop 需要 105 个周期,SGD 则需要 1763 个周期。
  • 改进的 Rprop 将训练时间缩短至 10 分钟(单 GPU 系统),而 Rprop 为 25 分钟,SGD 为 320 分钟。
  • 该方法使得在普通台式机系统上,10 个成员的堆叠集成模型在 12 小时内完成训练,测试误差达到 2.19%。
  • Wilcoxon 符号秩检验确认,10 个成员的集成模型在 98% 置信水平下显著优于 3 个成员的集成模型。
  • 改进的 Rprop 在整个训练过程中保持了更快的收敛速度与更低的误差,避免了未经修改的 Rprop 所出现的过拟合与早期饱和现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。