Skip to main content
QUICK REVIEW

[论文解读] End-to-end Speech Recognition with Word-based RNN Language Models

Takaaki Hori, Jaejin Cho|arXiv (Cornell University)|Aug 8, 2018
Speech Recognition and Synthesis参考文献 22被引用 9
一句话总结

该论文提出了一种基于词的RNN语言模型,引入动态前瞻机制,取代端到端自动语音识别(ASR)中对独立字符级语言模型的需求,实现了更低的计算成本和具有竞争力的准确率。该方法在使用65K词表的WSJ Eval'92数据集上达到了5.1%的词错误率(WER),为目前最优结果。

ABSTRACT

This paper investigates the impact of word-based RNN language models (RNN-LMs) on the performance of end-to-end automatic speech recognition (ASR). In our prior work, we have proposed a multi-level LM, in which character-based and word-based RNN-LMs are combined in hybrid CTC/attention-based ASR. Although this multi-level approach achieves significant error reduction in the Wall Street Journal (WSJ) task, two different LMs need to be trained and used for decoding, which increase the computational cost and memory usage. In this paper, we further propose a novel word-based RNN-LM, which allows us to decode with only the word-based LM, where it provides look-ahead word probabilities to predict next characters instead of the character-based LM, leading competitive accuracy with less computation compared to the multi-level LM. We demonstrate the efficacy of the word-based RNN-LMs using a larger corpus, LibriSpeech, in addition to WSJ we used in the prior work. Furthermore, we show that the proposed model achieves 5.1 %WER for WSJ Eval'92 test set when the vocabulary size is increased, which is the best WER reported for end-to-end ASR systems on this benchmark.

研究动机与目标

  • 消除端到端ASR中对独立字符级RNN-LM的需求,降低训练和解码开销。
  • 通过用提供前瞻词概率的单一基于词的RNN-LM替代多级语言模型解码,提升解码效率。
  • 在最小化计算和内存成本的前提下,实现与多级语言模型系统相当或更优的识别准确率。
  • 在WSJ和LibriSpeech基准上,针对不同词表大小验证该方法的有效性。

提出的方法

  • 在基于词的RNN-LM中引入前瞻机制,在束搜索过程中利用未来词的概率预测下一个字符。
  • 利用基于词的RNN-LM不仅为词边界提供语言模型得分,还为内部字符序列提供语言模型得分,从而取代字符级语言模型的作用。
  • 在解码过程中,通过在对数概率域中融合编码器-解码器输出与基于词的RNN-LM,实现浅层融合。
  • 采用束搜索策略,使用带有动态前瞻的基于词的RNN-LM对候选序列进行评分,从而避免使用独立的字符级语言模型。
  • 基于WSJ和LibriSpeech的转录文本数据,使用2层LSTM、每层650个单元训练基于词的RNN-LM。
  • 主ASR模型采用1层单向LSTM解码器(300个单元)和8层双向LSTM编码器(每层320个单元)。

实验结果

研究问题

  • RQ1一个带有前瞻机制的单一基于词的RNN-LM能否取代端到端ASR中对字符级和词级语言模型的双重需求?
  • RQ2所提方法是否在降低计算成本的同时,实现与多级语言模型系统相当或更优的识别准确率?
  • RQ3在标准基准上,随着词表大小的增加,该前瞻机制的基于词的RNN-LM性能如何变化?
  • RQ4该方法是否能在无需字符级语言模型的前提下,保持在WSJ和LibriSpeech等多样化数据集上的高准确率?

主要发现

  • 所提出的前瞻基于词的RNN-LM在使用65K词表的WSJ Eval'92测试集上达到了5.1%的WER,为该基准上端到端ASR报告的最低WER。
  • 与使用20K和65K词表的多级语言模型相比,使用前瞻LM的解码时间分别减少了40%和65%。
  • 即使在65K词表下,前瞻LM也将解码时间降低至多级LM的55%,展现出显著的效率提升。
  • 在LibriSpeech数据集上,前瞻LM在65K词表下实现了5.4%(dev clean)和15.6%(dev other)的WER,与多级LM性能相当。
  • 该方法消除了训练独立字符级RNN-LM的需求,降低了模型训练复杂度和内存占用。
  • 前瞻机制在WSJ和LibriSpeech上均表现出一致的错误率降低,尤其在词表规模增大时更为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。