Skip to main content
QUICK REVIEW

[论文解读] Quantization of Deep Neural Networks for Accurate Edge Computing

Wentao Chen, Hailong Qiu|arXiv (Cornell University)|Apr 25, 2021
Advanced Neural Network Applications参考文献 37被引用 4
一句话总结

本文提出渐进式量化作为一种正则化技术,可提升边缘设备上深度神经网络的准确率,在生物医学图像分割、图像分类和语音识别任务中实现最高达4.23%的准确率增益,同时实现3.5倍至6.4倍的内存压缩。该方法通过逐步降低网络权重的位宽来减少大模型中的过拟合,挑战了量化仅导致性能下降的传统观念。

ABSTRACT

Deep neural networks (DNNs) have demonstrated their great potential in recent years, exceeding the per-formance of human experts in a wide range of applications. Due to their large sizes, however, compressiontechniques such as weight quantization and pruning are usually applied before they can be accommodated onthe edge. It is generally believed that quantization leads to performance degradation, and plenty of existingworks have explored quantization strategies aiming at minimum accuracy loss. In this paper, we argue thatquantization, which essentially imposes regularization on weight representations, can sometimes help toimprove accuracy. We conduct comprehensive experiments on three widely used applications: fully con-nected network (FCN) for biomedical image segmentation, convolutional neural network (CNN) for imageclassification on ImageNet, and recurrent neural network (RNN) for automatic speech recognition, and experi-mental results show that quantization can improve the accuracy by 1%, 1.95%, 4.23% on the three applicationsrespectively with 3.5x-6.4x memory reduction.

研究动机与目标

  • 探究量化是否可作为正则化手段,从而提升模型性能,而非如传统观点认为的那样导致准确率下降。
  • 评估渐进式量化在三个真实应用场景(生物医学图像分割、ImageNet分类和自动语音识别)中的影响。
  • 证明量化可通过减少大模型中的过拟合,提升泛化能力与准确率。
  • 提供实证证据表明,通过量化实现的内存压缩并不必然以准确率为代价,有时甚至能提升准确率。
  • 探索在内存约束下能最大化准确率的最优量化位宽与并行模型配置。

提出的方法

  • 作者通过逐步将网络权重从全精度降低至低精度表示(如8位、6位、4位)的方式实施渐进式量化,采用受控的、分步的方法。
  • 在相同的硬件和框架条件下重新实现并评估最先进的量化方法,以确保公平比较。
  • 该方法从训练初期即使用量化权重,结合动态定点表示和权重缩放等技术,以保持表示能力。
  • 针对每项应用,测试不同位宽与并行配置(如双并行模型),以识别内存、计算与准确率之间的最优权衡。
  • 通过对比大模型与小模型的性能,分析量化对过拟合的影响,观察到大模型中过拟合减少,而小模型中则加剧。
  • 该方法将量化视为一种正则化形式,利用其固有的权重约束来提升过参数化网络的泛化能力。

实验结果

研究问题

  • RQ1量化是否可提升深度神经网络的准确率,而非导致其下降,特别是在过参数化模型中?
  • RQ2在多种DNN应用中,何种最优位宽可实现准确率最大化与内存使用最小化?
  • RQ3渐进式量化如何影响大模型与小模型中的过拟合?
  • RQ4采用量化权重的并行模型配置是否能进一步提升性能,超越单模型量化?
  • RQ5量化诱导的正则化是否在不同DNN架构与任务中均带来一致的准确率提升?

主要发现

  • 在MICCIA Gland数据集上,渐进式量化使生物医学图像分割的准确率提升了1%,优于当前最先进方法。
  • 在ImageNet-2012上使用VGG-16模型,8位定点量化使准确率相比全精度模型提升了1.95%。
  • 在TIMIT数据集上的自动语音识别任务中,使用Deep Speech模型,量化使准确率提升了4.23%。
  • 在所有三项应用中,内存使用量均减少了3.5倍至6.4倍,证明了显著的压缩效率。
  • 最优性能出现在中等位宽(如6–7位),而非最低或最高位宽,表明正则化与表示能力之间存在权衡。
  • 该方法减少了大模型中的过拟合,但在小模型中导致性能下降,证实其作为正则化机制的作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。