Skip to main content
QUICK REVIEW

[论文解读] Distilling with Performance Enhanced Students

Jack Turner, Elliot J. Crowley|arXiv (Cornell University)|Oct 24, 2018
Advanced Neural Network Applications参考文献 36被引用 4
一句话总结

本文提出了一种延迟感知蒸馏方法,通过结合Fisher剪枝与实际硬件性能测试,识别出最优的层宽,从而发现性能增强的学生网络。该方法利用推理加速中的阶梯状模式,在相同延迟下相比标准通道剪枝模型,将ImageNet的top-1准确率提升了超过10%,实现了更高的准确率而无需增加推理时间。

ABSTRACT

The task of accelerating large neural networks on general purpose hardware has, in recent years, prompted the use of channel pruning to reduce network size. However, the efficacy of pruning based approaches has since been called into question. In this paper, we turn to distillation for model compression---specifically, attention transfer---and develop a simple method for discovering performance enhanced student networks. We combine channel saliency metrics with empirical observations of runtime performance to design more accurate networks for a given latency budget. We apply our methodology to residual and densely-connected networks, and show that we are able to find resource-efficient student networks on different hardware platforms while maintaining very high accuracy. These performance-enhanced student networks achieve up to 10% boosts in top-1 ImageNet accuracy over their channel-pruned counterparts for the same inference time.

研究动机与目标

  • 为解决标准通道剪枝方法在通用硬件上因推理时间非线性缩放而导致的低效问题。
  • 克服以FLOPs作为推理时间代理指标的局限性,该指标无法捕捉硬件特定的性能瓶颈。
  • 开发一种结合剪枝与实际硬件性能测试的方法,以发现高准确率、低延迟的学生网络。
  • 通过识别在固定延迟预算内最大化准确率的性能增强型架构,提升模型压缩效果。
  • 在多个硬件平台和数据集上,于ResNet、WideResNet和DenseNet上验证该方法的有效性。

提出的方法

  • 对预训练的教师网络应用Fisher剪枝,每100个训练步骤移除一个通道,直至所有可剪枝通道被移除。
  • 利用目标硬件上的实际推理时间测量,识别出‘阶梯’点,即由于设备并行性得到最优利用而实现高效性能提升的时刻。
  • 通过在这些最优点选择层宽,构建延迟感知且性能优化的学生网络架构,避免使用非最优的FLOP近似方法。
  • 使用知识蒸馏与注意力迁移训练所得学生网络,由原始教师网络指导特征表示学习。
  • 通过包含平衡项β的蒸馏损失优化学生网络(在ImageNet上设为750,在CIFAR上设为1000),以调节注意力损失相对于交叉熵损失的权重。
  • 使用SGD优化学生网络,动量为0.9,权重衰减为0.0001,并在90个周期内采用余弦退火学习率调度策略进行微调(用于ImageNet)。

实验结果

研究问题

  • RQ1我们能否识别出FLOP指标无法捕捉的、由硬件特定性能决定的最优网络层宽?
  • RQ2将实际硬件性能测试与蒸馏结合,是否能在相同延迟下生成比标准剪枝更高的准确率学生网络?
  • RQ3性能增强的学生网络在不增加边缘设备推理时间的前提下,能将准确率提升多少?
  • RQ4该方法在不同网络架构(如ResNet、DenseNet、WideResNet)和数据集(如CIFAR-10、ImageNet)上的可扩展性如何?
  • RQ5能否利用推理时间中的阶梯状模式,在不牺牲延迟的前提下增加网络容量?

主要发现

  • 在使用ResNet-34的ImageNet上,性能增强的学生网络实现了32.29%的top-1错误率,相比在75%参数压缩率下Fisher剪枝模型的错误率,提升了超过10个百分点。
  • 尽管剪枝模型的top-1错误率上升了20%(达到43.43%),但性能增强的学生网络保持了相同的推理时间,证明无延迟代价。
  • 该方法成功识别出ARM Cortex-A57硬件上的最优层宽,其推理时间表现出非线性阶梯状模式,归因于硬件并行性。
  • 与通道剪枝基线相比,该方法在保持推理时间不变的前提下,将top-1准确率提升了10%以上,证明了硬件感知架构搜索的价值。
  • 性能增强的学生网络的MACs和参数量均高于剪枝模型,但通过瞄准延迟曲线上的最优点,仍保持了相同的推理速度。
  • 该技术在不同架构和数据集上具有良好的泛化能力,在CIFAR-10和ImageNet上均表现出色,且仅需极少的架构修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。