Skip to main content
QUICK REVIEW

[论文解读] Low Precision RNNs: Quantizing RNNs Without Losing Accuracy

Supriya Kapur, Asit Mishra|arXiv (Cornell University)|Oct 20, 2017
Advanced Neural Network Applications参考文献 8被引用 21
一句话总结

本文提出了一种循环神经网络(RNNs)的量化方法,在将权重和激活位宽降低至最低4位时,仍能保持完整的基线准确率。通过在量化过程中战略性地增加模型规模,该方法在实现低精度推理带来的显著硬件效率提升的同时,保持了性能。

ABSTRACT

Similar to convolution neural networks, recurrent neural networks (RNNs) typically suffer from over-parameterization. Quantizing bit-widths of weights and activations results in runtime efficiency on hardware, yet it often comes at the cost of reduced accuracy. This paper proposes a quantization approach that increases model size with bit-width reduction. This approach will allow networks to perform at their baseline accuracy while still maintaining the benefits of reduced precision and overall model size reduction.

研究动机与目标

  • 解决低精度RNN中模型效率与准确率之间的常见权衡问题。
  • 实现在不损失准确率的前提下,实现更低位宽的量化(例如4位)。
  • 探究在量化过程中增加模型规模是否能够保持性能。
  • 为RNN提供一种实用的量化框架,使其在各种低精度设置下均能保持准确率。

提出的方法

  • 该方法采用一种新颖的模型容量增强策略,结合训练后量化,以补偿位宽减少的影响。
  • 采用重参数化技术,使网络在低精度约束下能够学习更鲁棒的表示。
  • 该方法引入一种缩放机制,在量化过程中调整激活值和权重的范围,以最小化信息损失。
  • 应用量化感知训练原则,但无需完整微调,仅聚焦于量化后的微调。
  • 通过扩展隐藏层维度来增加模型规模,以抵消低精度权重和激活带来的表征能力损失。
  • 该方法应用于标准RNN架构(如GRUs和LSTMs)在序列建模基准上的实验。

实验结果

研究问题

  • RQ1当RNN被量化至4位精度时,能否保持基线准确率?
  • RQ2在量化过程中增加模型规模是否能缓解低精度RNN中的准确率下降?
  • RQ3与标准低精度量化方法相比,所提出的量化策略有多高效?
  • RQ4在低精度RNN中,模型规模、推理速度与准确率之间的权衡如何?

主要发现

  • 所提出的方法在标准语言建模基准上,即使在4位精度下,也能实现完整的基线准确率。
  • 通过增加模型容量的量化RNN在准确率方面优于标准低精度量化方法。
  • 该方法在不牺牲性能的前提下,实现了显著的模型压缩和硬件效率提升。
  • 该方法在多种RNN架构(包括GRUs和LSTMs)上均表现出色。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。