Skip to main content
QUICK REVIEW

[论文解读] On the efficient representation and execution of deep acoustic models

Raziel Álvarez, Rohit Prabhavalkar|arXiv (Cornell University)|Jul 15, 2016
Speech Recognition and Synthesis参考文献 19被引用 6
一句话总结

该论文提出了一种针对深度声学模型的简单8位整数量化方案,通过优化整数运算减少内存使用并加速推理,同时引入一种感知量化的训练过程,以恢复大部分由量化的精度损失。在基于LSTM的语音识别任务中,该方法即使在噪声环境下也能实现近乎无损的性能表现。

ABSTRACT

In this paper we present a simple and computationally efficient quantization scheme that enables us to reduce the resolution of the parameters of a neural network from 32-bit floating point values to 8-bit integer values. The proposed quantization scheme leads to significant memory savings and enables the use of optimized hardware instructions for integer arithmetic, thus significantly reducing the cost of inference. Finally, we propose a "quantization aware" training process that applies the proposed scheme during network training and find that it allows us to recover most of the loss in accuracy introduced by quantization. We validate the proposed techniques by applying them to a long short-term memory-based acoustic model on an open-ended large vocabulary speech recognition task.

研究动机与目标

  • 通过降低模型精度来实现在资源受限的移动设备上高效部署深度声学模型,同时不损失精度。
  • 解决将32位浮点权重后训练量化的8位整数量化导致的精度下降问题。
  • 开发一种训练感知的量化方法,以最小化全精度模型与量化模型之间的性能差距。
  • 在干净和噪声语音识别条件下,评估所提方案在基于长短期记忆网络(LSTM)的声学模型上的有效性。

提出的方法

  • 一种均匀线性量化器使用基于每层权重动态范围的缩放因子,将32位浮点权重映射为8位整数。
  • 推理过程中应用量化,通过简单的缩放和截断操作实现:$ V' = Q imes (V - V_{\text{min}}) $,其中 $ Q = \frac{255}{V_{\text{max}} - V_{\text{min}}} $。
  • 感知量化的训练过程在前向传播中使用量化的权重,但反向传播时使用全精度权重更新梯度,以模拟量化的噪声。
  • 该方法适用于除最终Softmax层外的所有层(在'quant'方案中),或在'quant-all'变体中适用于所有层。
  • 对LSTM投影层采用调度投影学习率策略,以在无需两阶段预训练的情况下加速训练收敛。
  • 该方法在大规模词汇量、开放式语音识别任务上,基于LSTM声学模型进行了验证。

实验结果

研究问题

  • RQ18位整数量化是否能在深度声学模型中显著降低内存和计算成本,同时保持较小的精度损失?
  • RQ2感知量化的训练在多大程度上能恢复因后训练量化的精度损失?
  • RQ3所提出的量化方案在噪声语音识别条件下是否仍能保持性能?
  • RQ4线性循环投影层的引入如何影响量化的鲁棒性与模型效率?
  • RQ5哪些训练策略(如学习率调度)能改善量化LSTM模型的收敛性和性能?

主要发现

  • 后训练量化的8位整数量化在噪声评估集上导致高达8.1%的相对WER退化,在干净集上高达5.1%。
  • 感知量化的训练在干净集上恢复了2.1%的精度损失,在噪声集上恢复了4.0%的精度损失,部分模型实现了近乎完全的恢复。
  • 包含投影层的模型对量化的鲁棒性更强,性能退化程度低于标准深度LSTM架构。
  • 'quant'方案(不将Softmax层纳入量化)在最终WER上略优于'quant-all'方案,表明高精度输出层有助于保持精度。
  • 调度投影学习率策略在收敛速度上优于SVD初始化,并消除了对两阶段训练的需求。
  • 所提出的量化方案通过SIMD优化的整数运算实现了显著加速,并降低了内存带宽需求,使其适用于嵌入式语音识别系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。