Skip to main content
QUICK REVIEW

[论文解读] Accelerating Convolutional Neural Networks via Activation Map Compression

Georgiadis Georgios|arXiv (Cornell University)|Dec 10, 2018
Advanced Neural Network Applications被引用 5
一句话总结

本文提出了一种三阶段流水线——稀疏化、量化和熵编码——用于压缩卷积神经网络中的激活图,以加速推理并减少内存使用。通过在早期层增加稀疏性并利用熵编码(尤其是对称指数戈卢布编码),该方法实现了高达6倍的压缩率,且准确率损失可忽略不计,使Inception-V3和MobileNet-V1的推理速度提升1.6倍,同时在ImageNet和CIFAR-10上分别实现0.38%和0.54%的准确率提升。

ABSTRACT

The deep learning revolution brought us an extensive array of neural network architectures that achieve state-of-the-art performance in a wide variety of Computer Vision tasks including among others, classification, detection and segmentation. In parallel, we have also been observing an unprecedented demand in computational and memory requirements, rendering the efficient use of neural networks in low-powered devices virtually unattainable. Towards this end, we propose a three-stage compression and acceleration pipeline that sparsifies, quantizes and entropy encodes activation maps of Convolutional Neural Networks. Sparsification increases the representational power of activation maps leading to both acceleration of inference and higher model accuracy. Inception-V3 and MobileNet-V1 can be accelerated by as much as $1.6\ imes$ with an increase in accuracy of $0.38\\%$ and $0.54\\%$ on the ImageNet and CIFAR-10 datasets respectively. Quantizing and entropy coding the sparser activation maps lead to higher compression over the baseline, reducing the memory cost of the network execution. Inception-V3 and MobileNet-V1 activation maps, quantized to $16$ bits, are compressed by as much as $6\ imes$ with an increase in accuracy of $0.36\\%$ and $0.55\\%$ respectively.

研究动机与目标

  • 解决现代CNN在移动设备和自动驾驶汽车等低功耗设备上的高计算与内存需求问题。
  • 通过压缩激活图来减少内存带宽和功耗,因为激活图的大小通常超过权重张量。
  • 实现在不损失模型准确率的前提下对激活图进行无损或近无损压缩。
  • 开发一种结合稀疏化、量化和熵编码的流水线,以最大化压缩和加速收益。
  • 证明在训练过程中可增强激活图的稀疏性而不引起准确率下降,从而同时提升效率和表征能力。

提出的方法

  • 在训练过程中通过在激活图上引入可学习的稀疏化诱导先验来应用稀疏化,从而在不损失准确率的情况下增加零激活的数量。
  • 该方法使用对称指数戈卢布(SEG)熵编码来高效压缩稀疏激活分布,其性能优于霍夫曼编码和指数戈卢布编码。
  • 量化将激活值的位宽减少至16、12或8位,进一步降低内存占用,并支持高效存储与传输。
  • 流水线按三个阶段执行:首先对激活图进行稀疏化,然后进行量化,最后对生成的稀疏低比特张量应用熵编码。
  • 该方法在Inception-V3、MobileNet-V1、ResNet-18/34和LeNet-5上进行了验证,涵盖ImageNet、CIFAR-10和MNIST数据集。
  • SEG和EG的参数选择在1,000张图像的验证子集上完成,以优化压缩与准确率之间的权衡。

实验结果

研究问题

  • RQ1能否在不降低模型准确率的前提下于训练过程中实现激活图的稀疏化?
  • RQ2与其它熵编码方案相比,对称指数戈卢布(SEG)编码在稀疏激活分布上的有效性如何?
  • RQ3激活图压缩在低功耗硬件加速器中能在多大程度上减少内存带宽和功耗?
  • RQ4稀疏化、量化和熵编码的结合能否在最小准确率损失下同时实现高效率压缩和高速推理?
  • RQ5在应用三阶段流水线时,压缩增益、推理速度与准确率之间的最优权衡是什么?

主要发现

  • Inception-V3和MobileNet-V1分别因稀疏化实现高达1.6倍的推理加速,准确率提升0.38%和0.54%。
  • 在16位量化和熵编码下,激活图压缩率最高可达6倍,在ImageNet和CIFAR-10上准确率分别提升0.36%和0.55%。
  • LeNet-5实现最高11倍压缩,准确率提升0.01%;而MobileNet-V1在16位量化下实现10倍压缩,准确率提升0.45%。
  • 稀疏化步骤使压缩增益相比基线模型提升1.1至2.0倍,相应推理速度提升1.2至2.3倍。
  • 对称指数戈卢布(SEG)编码在压缩增益方面优于霍夫曼编码、指数戈卢布(EG)、ZVC和ZLIB,尤其在高度稀疏分布上表现更优。
  • 该方法在硬件加速器中实现了显著的内存节省,其中激活内存访问主导功耗,可将片外DRAM访问减少高达6倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。