Skip to main content
QUICK REVIEW

[论文解读] Speeding up Convolutional Neural Networks with Low Rank Expansions

Max Jaderberg, Andrea Vedaldi|arXiv (Cornell University)|May 15, 2014
Advanced Neural Network Applications参考文献 32被引用 543
一句话总结

本文提出两种低秩扩展方案,通过利用通道间和滤波器间的冗余性,以秩-1空间基函数近似全秩滤波器,从而加速卷积神经网络。在场景文本识别基准上,实现了高达4.5倍的加速,且精度损失低于1%,无需修改网络结构即可实现实时推理。

ABSTRACT

The focus of this paper is speeding up the evaluation of convolutional neural networks. While delivering impressive results across a range of computer vision and machine learning tasks, these networks are computationally demanding, limiting their deployability. Convolutional layers generally consume the bulk of the processing time, and so in this work we present two simple schemes for drastically speeding up these layers. This is achieved by exploiting cross-channel or filter redundancy to construct a low rank basis of filters that are rank-1 in the spatial domain. Our methods are architecture agnostic, and can be easily applied to existing CPU and GPU convolutional frameworks for tuneable speedup performance. We demonstrate this with a real world network designed for scene text character recognition, showing a possible 2.5x speedup with no loss in accuracy, and 4.5x speedup with less than 1% drop in accuracy, still achieving state-of-the-art on standard benchmarks.

研究动机与目标

  • 解决预训练卷积神经网络(CNN)推理过程中的高计算成本问题,尤其针对实时应用。
  • 突破卷积层作为深度网络中处理时间主导瓶颈的限制。
  • 开发一种通用、与网络架构无关的方法,通过最小化对CPU/GPU框架的修改来加速现有CNN。
  • 通过控制近似保真度,实现速度与精度之间的可调制权衡。
  • 在真实世界应用——场景文本字符识别中,展示显著加速下的最先进性能。

提出的方法

  • 提出两种方案:方案1使用水平和垂直的秩-1滤波器来近似全2D滤波器组;方案2采用两阶段方法,先生成水平基函数,再进行垂直组合。
  • 通过SVD应用低秩近似,将滤波器组分解为可分离的秩-1分量,降低计算复杂度。
  • 采用两种优化策略:滤波器重建(最小化滤波器近似误差)和数据重建(最小化激活数据上的特征图误差)。
  • 使用标准卷积操作实现近似,确保与Caffe等现有框架及GPU/TPU流水线的兼容性。
  • 高效利用im2col和BLAS操作,方案2针对3D卷积例程进行优化,以最小化开销。
  • 将近似层集成到完整网络中,并在基准任务上进行端到端微调或性能评估。

实验结果

研究问题

  • RQ1能否在不造成显著精度损失的前提下,利用CNN中的通道间和滤波器间冗余性来降低计算成本?
  • RQ2在加速比和重建保真度方面,不同低秩近似方案(如可分离滤波器与基函数分解)有何差异?
  • RQ3在保持网络精度方面,数据驱动优化(最小化特征图误差)在多大程度上优于滤波器重建?
  • RQ4所提方法能否在真实世界CNN中实现显著加速,同时保持最先进性能?
  • RQ5该方法在不同网络层和架构上的可扩展性如何?是否可与其它加速技术结合?

主要发现

  • 在场景文本字符识别基准上,该方法实现了2.5倍加速且精度无损失,以及4.5倍加速仅损失1%精度,仍达到最先进性能。
  • 尽管方案1的理论重建误差更优,但方案2因与Caffe的3D卷积优化更好兼容,在实际推理速度上优于方案1。
  • 在相同加速水平下,数据重建优化的重建误差低于滤波器重建,即使在分布外数据上测试也成立。
  • 在相似层配置下,该方法的加速效果优于基于FFT的CNN,实现了2.4倍实际加速(使用256个基函数),优于先前工作的2.2倍。
  • 该方法优于以往低秩方法:在ImageNet上实现2倍理论加速,仅损失0.5% top-5精度,优于先前工作的1.2%损失。
  • 该方法与现有框架兼容,可与量化或硬件特定优化等其他加速技术结合使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。