[论文解读] LSTM Language Models for LVCSR in First-Pass Decoding and Lattice-Rescoring
本文提出了一种混合解码策略,结合首次通过LSTM语言模型(LSTM-LM)解码与词网重评分,以高效利用神经语言模型在LVCSR中的准确性。通过重新组合共享相同最后两个词的假设,并在GPGPU硬件上对生成的词网进行重评分,该方法在实时推理速度(RTF ≈ 1)下实现了具有竞争力的WER(Hub5'00测试集上为11.7%),优于标准回退语言模型解码和仅使用词网重评分的方法。
LSTM based language models are an important part of modern LVCSR systems as they significantly improve performance over traditional backoff language models. Incorporating them efficiently into decoding has been notoriously difficult. In this paper we present an approach based on a combination of one-pass decoding and lattice rescoring. We perform decoding with the LSTM-LM in the first pass but recombine hypothesis that share the last two words, afterwards we rescore the resulting lattice. We run our systems on GPGPU equipped machines and are able to produce competitive results on the Hub5'00 and Librispeech evaluation corpora with a runtime better than real-time. In addition we shortly investigate the possibility to carry out the full sum over all state-sequences belonging to a given word-hypothesis during decoding without recombination.
研究动机与目标
- 解决将LSTM-LM集成到语音识别解码中的高计算成本问题。
- 在保持或提升识别准确率的同时,提高解码效率,相比传统回退语言模型。
- 探索对HMM状态序列进行全和解码的可行性,以提升鲁棒性。
- 评估在大规模词汇量任务中,LSTM-LM在首次通过解码中结合重组与词网重评分的性能。
- 展示使用GPGPU加速解码实现实时推理,同时保持具有竞争力的WER。
提出的方法
- 在GPGPU上对LSTM-LM执行首次通过解码,基于最后两个词的限制进行重组,以减少搜索空间。
- 在词网重评分前,将共享相同三元组上下文的假设进行合并,以降低计算负载。
- 使用相同的LSTM-LM对生成的词网进行重评分,以优化词序列的概率。
- 使用修改后的动态规划函数计算路径概率求和而非最大化,从而实现全和解码。
- 将解码框架从RWTH ASR工具包扩展,以支持树条件搜索和动态语言模型状态管理。
- 未来优化考虑使用噪声对比估计(NCE),以减少大规模词汇量任务下的推理时间。
实验结果
研究问题
- RQ1LSTM-LM能否在首次通过解码中有效使用,且仅进行最小程度的重组,以维持实时性能?
- RQ2在首次通过解码后,使用LSTM-LM进行词网重评分是否比仅使用回退LM重评分获得更低的WER?
- RQ3与Viterbi解码相比,对HMM状态序列进行全和解码是否能提升识别准确率?
- RQ4首次通过LSTM解码的计算成本如何随词汇量增长而变化?能否针对大规模词汇量任务进行优化?
- RQ5与端到端LSTM-LM解码相比,重组与重评分的结合在WER和RTF方面是否表现更优?
主要发现
- 所提方法在Hub5'00评估集上实现了11.7%的WER,RTF约为1,证明了其在高准确率下具备实时性能。
- 在首次通过解码后,使用LSTM-LM进行词网重评分,其WER优于仅使用回退LM重评分。
- 当与混淆网络解码结合时,全和解码将WER从11.7%提升至11.4%,尽管搜索空间规模有所增加。
- 在Librispeech dev-clean数据集上,最佳策略(首次通过LSTM-LM结合重组与重评分)实现了2.39%的WER,RTF ≈ 6.95,表明在更大词汇量下计算成本更高。
- 在Librispeech的'other'条件下解码速度显著慢于'clean'条件(RTF高出约4倍),原因在于声学得分更相似。
- 该方法优于标准回退LM解码和使用回退模型的词网重评分,证实了在解码流程中更早集成LSTM-LM的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。