Skip to main content
QUICK REVIEW

[论文解读] Precision Gating: Improving Neural Network Efficiency with Dynamic Dual-Precision Activations

Yichi Zhang, Ritchie Zhao|arXiv (Cornell University)|Feb 17, 2020
Advanced Neural Network Applications参考文献 30被引用 16
一句话总结

本文提出精确门控(Precision Gating, PG),一种可端到端训练的动态双精度量化方法,该方法在低精度下计算大部分特征,同时利用可微分门控机制选择性地将关键特征升级至更高精度。PG 在仅造成极小精度损失的情况下,将计算成本降低至多 4.5 倍,在 LSTMs 上实现 1.2% 的困惑度降低和 2.7 倍的计算减少,在 ImageNet 上实现 3.5% 的准确率提升和 2.4 倍的计算减少,优于当前最先进方法。

ABSTRACT

We propose precision gating (PG), an end-to-end trainable dynamic dual-precision quantization technique for deep neural networks. PG computes most features in a low precision and only a small proportion of important features in a higher precision to preserve accuracy. The proposed approach is applicable to a variety of DNN architectures and significantly reduces the computational cost of DNN execution with almost no accuracy loss. Our experiments indicate that PG achieves excellent results on CNNs, including statically compressed mobile-friendly networks such as ShuffleNet. Compared to the state-of-the-art prediction-based quantization schemes, PG achieves the same or higher accuracy with 2.4$ imes$ less compute on ImageNet. PG furthermore applies to RNNs. Compared to 8-bit uniform quantization, PG obtains a 1.2% improvement in perplexity per word with 2.7$ imes$ computational cost reduction on LSTM on the Penn Tree Bank dataset. Code is available at: https://github.com/cornell-zhang/dnn-gating

研究动机与目标

  • 为解决静态量化在深度神经网络(DNNs)中的低效问题,即无论输入依赖的特征重要性如何,均分配固定精度。
  • 在不牺牲模型精度的前提下,降低 DNN 推理的计算成本,尤其适用于资源受限的边缘设备部署。
  • 实现在单个特征层面的端到端可训练、输入自适应的精度分配,从而提升效率与精度。
  • 引入可微分门控机制,使反向传播能够学习哪些特征需要更高精度。
  • 在标准基准(如 ImageNet 和 Penn Tree Bank)上,展示 PG 在多种架构(包括 CNNs 和 RNNs)中的有效性。

提出的方法

  • PG 在低精度(例如 3 位)下计算主 DNN 层,并通过学习的门控函数识别出高幅值输出特征作为重要特征。
  • 仅对选定的重要特征应用稀疏的高精度更新,实现在特征层面的双精度计算。
  • 门控函数具有可微性,允许反向传播优化哪些特征被升级,确保端到端训练。
  • PG 集成 PACT(参数化 ReLU 激活裁剪)以处理激活值中的异常值,降低低精度环境下的量化误差。
  • 更新阶段通过采样密集-密集矩阵乘法(SDDMM)核实现,高效利用稀疏性以实现加速。
  • 反向传播过程中保持稀疏性,使前向和反向传播均获得显著的计算节省。

实验结果

研究问题

  • RQ1动态、输入自适应的精度分配能否在不造成精度下降的情况下提升 DNN 推理效率?
  • RQ2可微分门控机制能否实现双精度 DNN 的端到端训练,且开销极小?
  • RQ3在 CNN 和 RNN 上,PG 与静态量化和基于预测的量化方法相比,在精度和计算成本方面表现如何?
  • RQ4更新阶段的稀疏性在 CPU 和 GPU 架构上对计算加速的贡献程度如何?
  • RQ5PG 是否能有效应用于卷积网络和循环网络,包括 ShuffleNet 等面向移动设备的模型以及 LSTMs?

主要发现

  • 在 ImageNet 上,PG 相较于基线 8 位量化方法,实现 3.5% 的 top-1 准确率提升,且计算成本降低 2.4 倍。
  • 在 CIFAR-10 上,PG 相较于 8 位基线,准确率提升 0.6%,计算成本最高降低 4.5 倍。
  • 在 Penn Tree Bank 数据集上,PG 相较于 8 位均匀量化,困惑度(PPW)降低 1.2%,计算成本降低 2.7 倍。
  • SDDMM 核实现的版本在 CPU 上相较密集 GEMM 最快可实现 8.3 倍的运行时间加速,稀疏度在 ResNet-20 各层中为 76% 至 99%。
  • PG 在反向传播期间诱导的稀疏度比前向传播高 6% 至 21%,在训练和推理阶段均实现显著节省。
  • 该方法与专用加速器兼容,预计在专用硬件上可实现至少 3 倍的加速和 5 倍的能效提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。