Skip to main content
QUICK REVIEW

[论文解读] CNN Acceleration by Low-rank Approximation with Quantized Factors

Nikolay Kozyrskiy, Anh Huy Phan|arXiv (Cornell University)|Jun 16, 2020
Tensor decomposition and applications参考文献 51被引用 5
一句话总结

该论文提出了一种新颖的CNN压缩方法,结合Tucker张量分解与权重量化和激活量化,以加速移动设备和嵌入式设备上的推理。通过使用贪婪秩选择和质量恢复技术,该方法在保持最小精度损失的前提下实现了高倍率压缩,在CIFAR-10、CIFAR-100和ImageNet基准测试中,于ResNet18和ResNet34上均优于现有方法。

ABSTRACT

The modern convolutional neural networks although achieve great results in solving complex computer vision tasks still cannot be effectively used in mobile and embedded devices due to the strict requirements for computational complexity, memory and power consumption. The CNNs have to be compressed and accelerated before deployment. In order to solve this problem the novel approach combining two known methods, low-rank tensor approximation in Tucker format and quantization of weights and feature maps (activations), is proposed. The greedy one-step and multi-step algorithms for the task of multilinear rank selection are proposed. The approach for quality restoration after applying Tucker decomposition and quantization is developed. The efficiency of our method is demonstrated for ResNet18 and ResNet34 on CIFAR-10, CIFAR-100 and Imagenet classification tasks. As a result of comparative analysis performed for other methods for compression and acceleration our approach showed its promising features.

研究动机与目标

  • 解决在功耗、内存和延迟要求严格的移动和嵌入式设备上部署大型、计算密集型CNN的挑战。
  • 通过协同结合低秩逼近与量化技术,克服现有压缩方法的局限性。
  • 为不同部署场景开发灵活可控的模型压缩率与精度损失之间的权衡机制。
  • 实现端到端微调,实现高效部署,无需任务特定的再训练或复杂超参数调优。
  • 在标准基准(CIFAR-10、CIFAR-100、ImageNet)上,使用ResNet18和ResNet34架构验证该方法的有效性。

提出的方法

  • 对4D卷积核张量应用Tucker分解,通过低秩逼近减少参数量。
  • 采用贪婪的一步与多步算法,选择Tucker格式中的最优多线性秩,以平衡压缩率与精度。
  • 使用定点表示将网络权重量化和特征图(激活值)量化至4–8位,降低内存与计算成本。
  • 在分解与量化后引入质量恢复技术,以稳定训练过程并提升精度恢复效果。
  • 对压缩与量化后的模型执行端到端微调,以最小化压缩后的精度下降。
  • 通过可调的秩与位宽参数,控制压缩率与精度损失之间的权衡。

实验结果

研究问题

  • RQ1将Tucker分解与权重量化及激活量化相结合,能否在保持最小精度损失的前提下实现显著的CNN压缩?
  • RQ2所提出的贪婪秩选择算法在识别卷积层最优低秩逼近方面有多高效?
  • RQ3质量恢复技术在分解与量化后,对收敛性与精度恢复的改善程度如何?
  • RQ4在标准基准测试中,该方法与最先进压缩技术相比,在压缩率与精度方面表现如何?
  • RQ5该方法能否在不同模型与数据集上灵活应用,并实现压缩与性能之间可控的权衡?

主要发现

  • 与现有方法相比,该方法在压缩与加速性能方面表现更优,尤其在结合8位量化时优势显著。
  • 在ImageNet上,该方法除基于空间SVD的方法外,优于所有其他方法,且额外具备量化带来的效率增益。
  • 该方法实现了压缩率与精度损失之间的可控权衡,适用于不同硬件约束的设备部署。
  • 端到端微调显著提升了收敛性与精度恢复效果,优于未微调或初始化不佳的压缩策略。
  • Tucker分解与量化相结合显著降低了FLOPs与模型大小,使模型更适用于移动设备与实时应用。
  • 该方法具有良好的泛化能力,可作为即插即用模块集成至深度学习框架中,实现开箱即用的模型压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。