Skip to main content
QUICK REVIEW

[论文解读] INT8 Winograd Acceleration for Conv1D Equipped ASR Models Deployed on Mobile Devices

Yiwu Yao, Yuchao Li|arXiv (Cornell University)|Oct 28, 2020
Fault Detection and Control Systems参考文献 21被引用 8
一句话总结

本文提出了一种新颖的 INT8 Winograd 量化流水线,结合范围缩放量化(RSQ)训练与低精度 Winograd 卷积,以加速移动设备上的基于 Conv1D 的自动语音识别(ASR)模型。通过在微调过程中联合优化量化范围并最小化量化噪声,该方法在 ARMv7 设备上实现了高达 1.48× 的加速,且 WER 仅增加 0.07%,优于标准 INT8 GEMM 和 PTQ 方法,同时保持了模型精度。

ABSTRACT

The intensive computation of Automatic Speech Recognition (ASR) models obstructs them from being deployed on mobile devices. In this paper, we present a novel quantized Winograd optimization pipeline, which combines the quantization and fast convolution to achieve efficient inference acceleration on mobile devices for ASR models. To avoid the information loss due to the combination of quantization and Winograd convolution, a Range-Scaled Quantization (RSQ) training method is proposed to expand the quantized numerical range and to distill knowledge from high-precision values. Moreover, an improved Conv1D equipped DFSMN (ConvDFSMN) model is designed for mobile deployment. We conduct extensive experiments on both ConvDFSMN and Wav2letter models. Results demonstrate the models can be effectively optimized with the proposed pipeline. Especially, Wav2letter achieves 1.48* speedup with an approximate 0.07% WER decrease on ARMv7-based mobile devices.

研究动机与目标

  • 解决由于计算-内存访问比低而导致的移动端部署的基于 Conv1D 的 ASR 模型性能瓶颈。
  • 克服在结合量化与 Winograd 卷积时出现的精度溢出与信息丢失问题。
  • 通过整合量化与快速卷积技术,实现在移动端的高效、低延迟推理。
  • 设计一种面向移动端优化的 ASR 模型(ConvDFSMN),使其能从所提出的优化流水线中受益。
  • 通过端到端训练与优化,实现高速推理并最大限度减少精度损失。

提出的方法

  • 提出范围缩放量化(RSQ)训练方法,通过扩展量化数值范围以防止 Winograd 变换中的溢出。
  • 在微调过程中引入量化噪声损失函数,以最小化低精度量化带来的精度损失。
  • 应用 Winograd 的最小滤波技术,将标准卷积替换为 Winograd 域中的高效哈达玛乘积运算。
  • 在 Winograd 域中使用全整数哈达玛乘法,以加速移动端的 INT8 Winograd 推理。
  • 将 RSQ 微调与 INT8 Winograd 优化整合为统一的流水线,以支持移动端部署。
  • 设计一种新型的配备 Conv1D 的 DFSMN 模型(ConvDFSMN),具备更高的效率与更强的量化鲁棒性。

实验结果

研究问题

  • RQ1在不引发精度溢出或性能下降的前提下,能否有效结合 INT8 量化与 Winograd 卷积?
  • RQ2与标准的后训练量化(PTQ)相比,范围缩放量化(RSQ)在量化后如何提升模型精度?
  • RQ3在微调过程中最小化量化噪声对最终 ASR 性能的影响如何,尤其是在 INT8 Winograd 加速后?
  • RQ4所提出的流水线在 ARMv7 移动设备上能在多大程度上降低推理延迟,同时保持 WER 性能?
  • RQ5与基于标准 INT8 GEMM 和 PTQ 的 Winograd 方法相比,该方法在真实 ASR 模型上的加速比与精度表现如何?

主要发现

  • 所提出的 RSQ 训练方法可降低量化误差并防止 Winograd 变换中的溢出,从而实现稳定的 INT8 Winograd 推理。
  • 在 Wav2letter 模型上,该方法在基于 ARMv7 的移动设备上实现了 1.48× 的加速,且 WER 仅增加 0.07%。
  • ConvDFSMN-s 模型在 Aishell-1 上经 RSQ 微调后达到 10.52% 的 WER,尽管参数量更少,但仍优于 Wav2letter(13.71% WER)。
  • INT8 Winograd 在所有 Conv1D 卷积核尺寸上均提供稳定的加速,Wav2letter 中 15×1 核心的加速最高达 1.3×。
  • RSQ 方法消除了后训练量化中对校准集的需求,简化了量化流水线。
  • 在滤波器维度为 1024 的 ConvDFSMN 中,Conv1D 操作的延迟最高降低 24%(从 0.881ms 降至 0.710ms)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。