Skip to main content
QUICK REVIEW

[论文解读] Trace norm regularization and faster inference for embedded speech recognition RNNs

Markus Kliegl, Siddharth Goyal|arXiv (Cornell University)|Oct 25, 2017
Speech Recognition and Synthesis参考文献 6被引用 6
一句话总结

本文将核范数正则化引入语音识别模型中的低秩循环和全连接层训练,实现无需预先知晓秩的更好参数-精度权衡。同时,本文提出针对ARM64架构的优化内核,使低批量大小下的推理速度提升3倍至7倍,显著提升嵌入式LVCSR系统的本地性能。

ABSTRACT

We propose and evaluate new techniques for compressing and speeding up dense matrix multiplications as found in the fully connected and recurrent layers of neural networks for embedded large vocabulary continuous speech recognition (LVCSR). For compression, we introduce and study a trace norm regularization technique for training low rank factored versions of matrix multiplications. Compared to standard low rank training, we show that our method leads to good accuracy versus number of parameter trade-offs and can be used to speed up training of large models. For speedup, we enable faster inference on ARM processors through new open sourced kernels optimized for small batch sizes, resulting in 3x to 7x speed ups over the widely used gemmlowp library. Beyond LVCSR, we expect our techniques and kernels to be more generally applicable to embedded neural networks with large fully connected or recurrent layers.

研究动机与目标

  • 解决在资源受限的嵌入式设备上部署大型、高精度语音识别模型所面临的严格延迟与大小约束的挑战。
  • 通过压缩RNN和全连接层中的密集矩阵乘法,减小大规模词汇连续语音识别(LVCSR)系统的模型大小与推理延迟。
  • 通过一种新颖的核范数正则化技术,自动选择最优秩,提升低秩分解网络的训练效率与模型精度。
  • 通过为小批量大小量身定制的专用内核,优化ARM处理器上的推理性能,这在序列RNN处理中非常常见。

提出的方法

  • 在训练过程中应用变分核范数正则化,以在权重矩阵中诱导低秩结构,促进奇异值的稀疏性,而无需手动选择秩。
  • 采用两阶段训练方法:首先预训练一个满秩模型,然后通过预训练权重的截断SVD初始化低秩模型,再进行核范数正则化的微调。
  • 为64位ARM(AArch64)处理器实现手写优化的汇编内核,针对小批量大小(1–4),提升内存带宽利用率与计算效率。
  • 将核范数正则化与int8量化及模型剪枝相结合,进一步压缩模型,同时保持精度。
  • 在iPhone 7、iPhone 6和Raspberry Pi 3等设备上,与广泛使用的低精度GEMM库gemmlowp进行性能对比基准测试。
  • 通过GitHub发布优化后的内核与实现细节,以促进在嵌入式深度学习系统中的广泛采用。

实验结果

研究问题

  • RQ1核范数正则化是否能在无需预先知晓最优秩的情况下,提升低秩分解RNN在语音识别中的准确率与参数效率?
  • RQ2核范数正则化在减少参数数量的同时,能否在LVCSR模型中保持具有竞争力的WER?
  • RQ3与gemmlowp等现有库相比,定制的ARM64内核在低批量大小的GEMM运算中能将推理速度提升多少?
  • RQ4小批量大小优化对本地语音识别系统端到端延迟的影响有多大?
  • RQ5低秩分解、量化与优化内核的结合,是否能实现在多种嵌入式设备上生产级的本地语音识别?

主要发现

  • 核范数正则化实现了自动秩选择,并在准确率与参数效率的权衡上优于标准低秩训练,相比全尺寸基线模型,WER相对降低分别为-19.6%(iPhone 7)、-27.4%(iPhone 6)和-37.6%(Raspberry Pi 3)。
  • 所提出的ARM64优化内核在iPhone 7、iPhone 6和Raspberry Pi 3等设备上,推理速度比gemmlowp快3倍至7倍,尤其在低批量大小(1–4)场景下优势显著。
  • 低秩分解、int8量化与自定义内核的结合,使声学模型大小最低可压缩至14 MB(Raspberry Pi 3),同时保持可接受的WER。
  • 推理延迟显著降低,实时因子从GPU服务器上的10.39降至Raspberry Pi 3上的1.08,达到实时性能的86.3%。
  • 该方法具有可推广性,不仅适用于LVCSR,还为在嵌入式平台上压缩与加速具有大型密集层或循环层的神经网络提供了实用框架。
  • 核范数正则化技术被证明能有效诱导低秩结构,相比标准SVD初始化,收敛性更好,且对初始秩选择的敏感性更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。