Skip to main content
QUICK REVIEW

[论文解读] FPGA-Based Low-Power Speech Recognition with Recurrent Neural Networks

Minjae Lee, Kyuyeon Hwang|arXiv (Cornell University)|Sep 30, 2016
Speech Recognition and Synthesis参考文献 23被引用 5
一句话总结

该论文提出了一种基于FPGA的低功耗实时语音识别系统,采用两个长短期记忆(LSTM)循环神经网络(RNN):一个用于声学建模,另一个用于字符级语言建模,并结合统计词级语言模型。系统采用6位定点量化权重,全部存储在片上FPGA内存中,实现高吞吐量且极少访问DRAM,在仅9.24 W功耗下达到4.12×实时性能,相比基于GPU的系统展现出10倍能效提升。

ABSTRACT

In this paper, a neural network based real-time speech recognition (SR) system is developed using an FPGA for very low-power operation. The implemented system employs two recurrent neural networks (RNNs); one is a speech-to-character RNN for acoustic modeling (AM) and the other is for character-level language modeling (LM). The system also employs a statistical word-level LM to improve the recognition accuracy. The results of the AM, the character-level LM, and the word-level LM are combined using a fairly simple N-best search algorithm instead of the hidden Markov model (HMM) based network. The RNNs are implemented using massively parallel processing elements (PEs) for low latency and high throughput. The weights are quantized to 6 bits to store all of them in the on-chip memory of an FPGA. The proposed algorithm is implemented on a Xilinx XC7Z045, and the system can operate much faster than real-time.

研究动机与目标

  • 开发一种适用于嵌入式和移动应用的低功耗、实时语音识别系统。
  • 通过权重量化将所有RNN权重存储在片上FPGA内存中,减少对片外DRAM的依赖。
  • 用轻量级N-best束搜索替代复杂的HMM解码,结合基于RNN的声学模型和语言模型。
  • 通过字符级RNN与统计词级语言模型,实现端到端、词汇无关的语音识别。
  • 利用FPGA上的大规模并行处理单元(PE),实现高吞吐量与低延迟。

提出的方法

  • 系统使用单向RNN进行声学建模(AM),并使用独立的RNN进行字符级语言建模(LM),两者均通过连接时序分类(CTC)进行训练。
  • 采用树形结构的N-best束搜索,束宽为128,整合AM、字符级LM与统计词级LM的输出,避免使用HMM或WFST网络。
  • 所有RNN权重通过基于微调的优化方法量化为6位定点精度,将内存占用减少至约1.1 MB,实现在Xilinx XC7Z045 FPGA上的完全片上存储。
  • RNN通过大规模并行处理单元(PE)实现,以加速矩阵-向量乘法运算,支持高吞吐量推理。
  • 系统仅将词级语言模型卸载至片外DRAM,最大限度减少高能耗的内存访问。
  • FPGA工作频率为100 MHz,CPU以800 MHz处理N-best搜索,在WSJ eval92数据集上实现4.12×实时性能。

实验结果

研究问题

  • RQ1能否在FPGA上高效实现完全基于RNN的语音识别系统,同时将片外内存访问降至最低?
  • RQ26位权重量化在保持识别准确率的同时,是否能有效实现所有模型参数的片上存储?
  • RQ3轻量级N-best束搜索能否在不牺牲识别性能的前提下替代HMM或WFST解码?
  • RQ4与基于GPU的实现相比,基于FPGA的RNN系统在实时性能与能效方面能达到何种水平?
  • RQ5在端到端、词汇无关的设置下,字符级RNN与词级语言模型在联合提升识别准确率方面有多大潜力?

主要发现

  • 基于FPGA的系统在100 MHz时钟下于WSJ eval92数据集上实现了4.12×实时性能,其单位功耗下的处理速度显著优于基于GPU的系统。
  • 评估板总功耗仅为9.24 W(含DRAM与外设),相比用于对比的高端GPU(NVIDIA Titan X)实现了10倍的能效提升。
  • 采用6位定点量化权重后,模型大小减小至约1.1 MB,完全适配Xilinx XC7Z045 FPGA的2.18 MB片上内存,无需访问DRAM中的RNN权重。
  • 词级语言模型提升了识别准确率,且在固定点权重下通过重打分进一步优化了性能。
  • 与全精度模型相比,使用6位量化后,词错误率(WER)仅增加约1.5%,表明在准确率与效率之间实现了有效权衡。
  • FPGA实现中,N-best束搜索仅需197 KB数据结构,相比传统HMM-based WFST网络所需的数百万字节,实现显著压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。