Skip to main content
QUICK REVIEW

[论文解读] Adaptive Quantization for Deep Neural Network

Yiren Zhou, Seyed-Mohsen Moosavi-Dezfooli|arXiv (Cornell University)|Dec 4, 2017
Advanced Image and Video Retrieval Techniques参考文献 3被引用 15
一句话总结

本文提出了一种自适应量化框架,通过使用理论基础坚实的量化误差影响测量方法,对深度神经网络中各层的位宽进行优化。通过最小化各层量化噪声的累积效应,该方法在相同准确率水平下,相较于等位宽量化和最先进的SQNR基准方法,实现了20–40%更高的压缩率。

ABSTRACT

In recent years Deep Neural Networks (DNNs) have been rapidly developed in various applications, together with increasingly complex architectures. The performance gain of these DNNs generally comes with high computational costs and large memory consumption, which may not be affordable for mobile platforms. Deep model quantization can be used for reducing the computation and memory costs of DNNs, and deploying complex DNNs on mobile equipment. In this work, we propose an optimization framework for deep model quantization. First, we propose a measurement to estimate the effect of parameter quantization errors in individual layers on the overall model prediction accuracy. Then, we propose an optimization process based on this measurement for finding optimal quantization bit-width for each layer. This is the first work that theoretically analyse the relationship between parameter quantization errors of individual layers and model accuracy. Our new quantization algorithm outperforms previous quantization optimization methods, and achieves 20-40% higher compression rate compared to equal bit-width quantization at the same model prediction accuracy.

研究动机与目标

  • 为解决均匀位宽量化在DNN各层中的低效问题,该问题未能考虑各层对量化敏感度的结构性差异。
  • 开发一种理论基础坚实的度量方法,将单个层的量化误差与整体模型准确率下降联系起来。
  • 实现高效、非穷举的逐层位宽优化,避免在深层网络中进行不可行的指数级搜索。
  • 通过在相同准确率下实现更高压缩率,超越现有量化方法,特别是SQNR基准方法和等位宽方法。

提出的方法

  • 提出基于残差误差向量L2范数的测量方法,量化每层中量化噪声对整体模型预测准确率的影响。
  • 推导出理论框架,表明当噪声较小时,总量化误差在各层间近似可加,从而实现可扩展的优化。
  • 利用此可加误差模型,计算每层的最优位宽,以在满足准确率约束的前提下最小化总误差。
  • 对每层应用均匀量化,位宽由所提出的误差测量方法确定,避免对所有位宽组合进行穷举搜索。
  • 在ImageNet模型上对可加性假设进行经验验证,结果表明在低噪声条件下具有强一致性。
  • 采用无梯度、迭代的优化过程,在各层间平衡压缩率与准确率。

实验结果

研究问题

  • RQ1DNN各层中的量化误差如何共同影响整体模型的预测准确率?
  • RQ2是否可以构建一个理论基础坚实的可加误差模型,准确预测逐层量化对最终模型性能的影响?
  • RQ3在压缩-准确率权衡方面,逐层自适应位宽分配是否优于均匀位宽或SQNR基准的位宽选择?
  • RQ4所提出的方法在多种DNN架构(如AlexNet、VGG-16、GoogleNet和ResNet-50)中是否具备可扩展性和有效性?

主要发现

  • 在相同准确率退化水平下,该方法在AlexNet和VGG-16上实现的模型尺寸比等位宽量化小30–40%。
  • 在GoogleNet和ResNet-50上,该方法在相同准确率约束下实现的模型尺寸比等位宽量化小15–20%。
  • 该方法在所有测试模型中均持续优于基于SQNR的量化方法,包括在SQNR方法表现不佳的ResNet-50上。
  • 经验验证结果确认了在低噪声条件下量化误差范数的可加性,支持了该方法的理论基础。
  • 由于采用了分数位宽优化,该方法生成的位宽组合数量多于基于SQNR的方法,从而实现了更精细的压缩控制。
  • 理论分析首次建立了逐层量化误差与整体DNN准确率之间的联系,为自适应量化提供了原则性基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。