Skip to main content
QUICK REVIEW

[论文解读] Minimal Effort Back Propagation for Convolutional Neural Networks

Bingzhen Wei, Xu Sun|arXiv (Cornell University)|Sep 18, 2017
Advanced Neural Network Applications参考文献 14被引用 20
一句话总结

该论文提出 meProp-CNN,一种通过基于梯度大小选择性地反向传播前 k 个梯度来减少卷积神经网络中反向传播计算量的方法。尽管仅使用 5% 的梯度,该模型在准确率上与标准 CNN 相当或更优,且对过拟合更具鲁棒性,并与动量法和批量归一化等优化技术兼容。

ABSTRACT

As traditional neural network consumes a significant amount of computing resources during back propagation, \citet{Sun2017mePropSB} propose a simple yet effective technique to alleviate this problem. In this technique, only a small subset of the full gradients are computed to update the model parameters. In this paper we extend this technique into the Convolutional Neural Network(CNN) to reduce calculation in back propagation, and the surprising results verify its validity in CNN: only 5\% of the gradients are passed back but the model still achieves the same effect as the traditional CNN, or even better. We also show that the top-$k$ selection of gradients leads to a sparse calculation in back propagation, which may bring significant computational benefits for high computational complexity of convolution operation in CNN.

研究动机与目标

  • 为减少卷积神经网络(CNN)中反向传播的高计算成本,其根源在于卷积操作中昂贵的矩阵乘法。
  • 将最初为全连接网络设计的最小努力反向传播(meProp)技术扩展至 CNN,以实现稀疏梯度更新。
  • 评估通过前 k 个梯度选择实现的稀疏反向传播是否能在显著降低计算负载的同时保持或提升模型准确率。
  • 研究 meProp-CNN 与动量法和批量归一化等优化技术在 CNN 训练中的兼容性。

提出的方法

  • 在反向传播过程中,该方法在每一层仅选择绝对值最大的前 k 个梯度值,其余梯度设为零,从而实现稀疏更新。
  • 该稀疏梯度更新被应用于卷积层,将密集矩阵乘法转化为稀疏运算,计算成本与前 k 比例成比例降低。
  • 该方法与 Adam 及带动量的随机梯度下降结合使用,其中动量衰减率经过调整以平衡收敛稳定性和稀疏性。
  • 该方法选择性地应用于卷积层,而全连接层则使用完整梯度进行更新,以保持最终分类层的性能。
  • 该技术通过忽略相关性较弱的参数,行为上类似于 Dropout,从而减少过拟合并提升泛化能力。
  • 批量归一化进一步加速收敛并提升测试准确率,证明其与 meProp-CNN 兼容。

实验结果

研究问题

  • RQ1基于前 k 个梯度选择的稀疏反向传播方法是否能在降低计算成本的同时保持或提升 CNN 的模型准确率?
  • RQ2前 k 比例的选择如何影响 CNN 的收敛性、准确率以及对过拟合的鲁棒性?
  • RQ3当与动量法和批量归一化等优化技术结合时,meProp-CNN 方法是否仍保持有效性?
  • RQ4meProp-CNN 的性能是否对梯度的层特定分布敏感,特别是在更深或全连接层中?

主要发现

  • 在反向传播中仅使用完整梯度的 5%,meProp-CNN 在 MNIST 上达到 99.07% 的测试准确率,与基线 CNN 的 99.02% 相当或略高。
  • 当采用 top-k = 5% 且动量衰减率为 0.6 时,模型达到 99.27% 的测试准确率,优于基线模型,且表现出更少的过拟合。
  • 与批量归一化结合后,使用 5% top-k 梯度的 meProp-CNN 达到 99.39% 的测试准确率,超过基线的 99.28%。
  • 动量衰减率为 0.6 的结果优于 0.9,表明过大的动量可能限制梯度多样性并阻碍收敛。
  • 该方法在多次实验中表现一致,前 k 比例在 5% 至 10% 范围内时,准确率稳定且常优于完整反向传播。
  • 结果表明,通过跳过对不相关参数的更新,meProp-CNN 本质上减少了过拟合,类似于 Dropout,同时保持了高模型容量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。