Skip to main content
QUICK REVIEW

[论文解读] On the quantization of recurrent neural networks

Jian Li, Raziel Álvarez|arXiv (Cornell University)|Jan 14, 2021
Advanced Neural Network Applications参考文献 18被引用 7
一句话总结

本文提出了一种仅使用8位整数运算的长短期记忆(LSTM)网络整数化量化策略,可在仅使用8位整数运算的情况下实现高精度、高效率且硬件可移植的推理。通过利用预先计算的零点和对称量化,该方法在训练后实现近乎无损的精度,且在CPU上推理速度比FP32快达2倍,内存占用极小,且推理过程中无需浮点运算。

ABSTRACT

Integer quantization of neural networks can be defined as the approximation of the high precision computation of the canonical neural network formulation, using reduced integer precision. It plays a significant role in the efficient deployment and execution of machine learning (ML) systems, reducing memory consumption and leveraging typically faster computations. In this work, we present an integer-only quantization strategy for Long Short-Term Memory (LSTM) neural network topologies, which themselves are the foundation of many production ML systems. Our quantization strategy is accurate (e.g. works well with quantization post-training), efficient and fast to execute (utilizing 8 bit integer weights and mostly 8 bit activations), and is able to target a variety of hardware (by leveraging instructions sets available in common CPU architectures, as well as available neural accelerators).

研究动机与目标

  • 开发一种LSTM网络的全整数量化策略,在保持高模型精度的同时,实现在多种硬件上的高效部署。
  • 消除推理过程中对浮点运算的依赖,提升能效并增强硬件兼容性。
  • 实现仅需极少数据且无需微调的训练后量化,确保在生产系统中的实际可部署性。
  • 通过预先计算零点校正并将其折叠到偏置项中,优化整数执行效率。
  • 为其他RNN变体(包括GRUs和SRUs)的量化提供可扩展的基础。

提出的方法

  • 对权重和激活均采用对称的8位整数量化,使用学习得到的比例因子和零点参数。
  • 采用训练后量化,仅在少量数据(100个语音样本)上收集统计信息,无需微调。
  • 离线预先计算零点项,并将其折叠到偏置中,消除运行时量化开销。
  • 重写TensorFlow计算图,解耦输入与循环权重/激活的拼接操作,以实现精确的张量级量化。
  • 在量化流程中保留层归一化和门控连接,以保持数值稳定性。
  • 支持标准LSTM和CIFG变体,对模型压缩采用稀疏感知量化。

实验结果

研究问题

  • RQ1能否为LSTM网络设计一种全整数量化策略,在无需浮点运算的情况下保持高推理精度?
  • RQ2在仅使用极少数据的情况下,训练后量化对LSTM模型的性能如何,特别是在长序列上的表现如何?
  • RQ3在CPU架构上,可对整数量化LSTM推理应用哪些优化以实现最大加速和能效提升?
  • RQ4所提出的量化策略能否推广到其他RNN变体(如GRUs和SRUs)?
  • RQ5该量化策略在不同语音识别数据集(序列长度各异)上的表现如何?

主要发现

  • 仅使用100个语音样本进行训练后量化,即可在所有数据集上实现可忽略的精度损失,包括长达16.5分钟的YouTube语音样本。
  • 全整数量化模型在VoiceSearch上达到6.7% WER,在YouTube上为19.8%,在Telephony上为8.2%,与浮点基线模型精度一致。
  • 整数量化将模型大小从FP32的466MB减少至8位整数的117MB,压缩率达75%。
  • 优化后的整数量化LSTM在CPU上比混合量化快5%,比FP32快2倍,且无需运行时比例因子计算。
  • 该方法支持50%稀疏度的LSTM,模型大小可进一步减小至71MB(整数)和57MB(稀疏整数),且精度下降可忽略。
  • 该策略可直接应用于双向LSTM、GRUs及其他RNN变体,性能与精度保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。