Skip to main content
QUICK REVIEW

[论文解读] Accelerating Deep Learning by Focusing on the Biggest Losers

Angela H. Jiang, Daniel Wong|arXiv (Cornell University)|Oct 2, 2019
Advanced Neural Network Applications参考文献 27被引用 36
一句话总结

Selective-Backprop 优先处理高损失的训练样本,以跳过代价高昂的反向传播,从而加速深度学习;Stale-SB 进一步降低选择开销,与标准 SGD 相比在训练速度上提升高达 3.5 倍。

ABSTRACT

This paper introduces Selective-Backprop, a technique that accelerates the training of deep neural networks (DNNs) by prioritizing examples with high loss at each iteration. Selective-Backprop uses the output of a training example's forward pass to decide whether to use that example to compute gradients and update parameters, or to skip immediately to the next example. By reducing the number of computationally-expensive backpropagation steps performed, Selective-Backprop accelerates training. Evaluation on CIFAR10, CIFAR100, and SVHN, across a variety of modern image models, shows that Selective-Backprop converges to target error rates up to 3.5x faster than with standard SGD and between 1.02--1.8x faster than a state-of-the-art importance sampling approach. Further acceleration of 26% can be achieved by using stale forward pass results for selection, thus also skipping forward passes of low priority examples.

研究动机与目标

  • 通过关注信息量更高(更难的)样本来加速 DNN 训练,而不是把所有样本一视同仁,说明需求。
  • 提出一种轻量级、基于损失的采样技术,在不牺牲准确性的前提下降低反向传播工作量。
  • 在多种数据集和网络架构上评估该方法,以量化加速效果和鲁棒性。

提出的方法

  • 介绍 Selective-Backprop (SB) ,使用前向传播损失作为梯度贡献的代理,以决定是否在反向传播中包含某个样本。
  • 将选择概率 P(L) 设为当前损失百分位数(基于 CDF)的单调函数,以偏向高损失样本的采样。
  • 使用最近损失的滑动窗口来近似计算 P(L) 时的当前损失分布。
  • 可选地使用 Stale-SB,在每第 n 个纪元重复使用前一轮选择的损失以降低前向传播成本。
  • 为降低选择开销提供可选优化,例如损失复用和前向传播加速等思路。
  • SB 设计为可与标准 SGD及其变体(Adam、RMSprop 等)一起使用,而不改变超参数。

实验结果

研究问题

  • RQ1Selective backpropagation 是否能够在不显著损害最终模型性能的前提下将训练时间降低到目标精度?
  • RQ2与最先进的在线重要性采样相比,SB 在速度提升和最终精度方面表现如何?
  • RQ3利用过时的前向传播结果(Stale)对训练效率和精度有何影响?
  • RQ4SB 对标签噪声和数据集冗余在常见图像分类基准上的鲁棒性如何?
  • RQ5在跨数据集和模型的实际部署考虑因素和帕累托最优配置是什么?

主要发现

  • SB 通过跳过低损失样本来减少反向传播计算,在 CIFAR10/100 和 SVHN 上的多种模型中实现了对目标误差的最高 3.5x 加速。
  • Stale-SB 通过对同一前向传播损失进行多轮复用,在精度损失极小的前提下获得约 26% 的额外加速。
  • SB 通常在达到目标精度方面优于最先进的在线重要性采样方法(Katharopoulos & Fleuret 2018),提升范围为 1.02–1.8x。
  • 在帕累托最优配置下,SB 和 Stale-SB 占据了大部分最佳权衡,SB 往往在 CIFAR10、CIFAR100 和 SVHN 上提供最佳的速度-精度平衡。
  • SB 对温和的标签噪声具有鲁棒性,能在干净数据集上加速学习;更高的选择性带来更快的速度,但可能提高最终误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。