Skip to main content
QUICK REVIEW

[论文解读] Contextualizing ASR Lattice Rescoring with Hybrid Pointer Network Language Model

Da-Rong Liu, Chunxi Liu|arXiv (Cornell University)|May 15, 2020
Speech Recognition and Synthesis参考文献 21被引用 5
一句话总结

本文提出了一种混合指针网络语言模型,通过利用视频元数据来改进自动语音识别(ASR)解码路径的重打分,方法是选择性地关注相关文本上下文。通过将语言模型条件化于视频描述,并使用指针机制提升罕见词的概率,该方法在基线模型上实现了显著的词错误率(WER)降低——最高达2%的相对提升,尤其在元数据与转录文本共享共现词汇时效果更明显。

ABSTRACT

Videos uploaded on social media are often accompanied with textual descriptions. In building automatic speech recognition (ASR) systems for videos, we can exploit the contextual information provided by such video metadata. In this paper, we explore ASR lattice rescoring by selectively attending to the video descriptions. We first use an attention based method to extract contextual vector representations of video metadata, and use these representations as part of the inputs to a neural language model during lattice rescoring. Secondly, we propose a hybrid pointer network approach to explicitly interpolate the word probabilities of the word occurrences in metadata. We perform experimental evaluations on both language modeling and ASR tasks, and demonstrate that both proposed methods provide performance improvements by selectively leveraging the video metadata.

研究动机与目标

  • 通过引入标题和描述等视频元数据中的上下文信息,提升ASR的准确性。
  • 通过开发一种选择性关注相关文本内容的方法,解决无关或噪声元数据带来的挑战。
  • 设计一种神经语言模型,利用混合指针机制有效处理罕见词和未登录词。
  • 将上下文语言模型与声学模型训练解耦,实现语言模型组件的模块化、独立优化。
  • 评估元数据质量对ASR性能的影响,并识别上下文建模带来最大收益的条件。

提出的方法

  • 使用编码器-解码器架构结合注意力机制,将视频元数据总结为上下文向量,训练一个条件化于视频元数据的神经语言模型。
  • 采用混合指针网络,将基于词汇表的生成头与指针机制相结合,直接从元数据序列中选择词元。
  • 在每个解码步骤使用软门控机制,动态选择从词汇表生成词元或指向元数据中的词。
  • 通过剪枝的解码路径重打分与n-gram近似方法,利用上下文神经语言模型对首个基于HMM的混合系统生成的ASR解码路径进行重打分。
  • 在验证集上通过调优权重,将神经语言模型得分与n-gram语言模型得分进行插值,以平衡语言建模与解码准确性。
  • 通过分析元数据与参考转录文本之间的共现关系,评估元数据相关性对性能提升的影响。

实验结果

研究问题

  • RQ1与标准语言模型相比,条件化于视频元数据的神经语言模型是否能提升ASR解码路径重打分性能?
  • RQ2在困惑度与WER方面,混合指针网络机制与标准RNN、缓存LSTM及注意力模型相比表现如何?
  • RQ3元数据质量(以元数据与转录文本共现词汇数衡量)对所提方法有效性有何影响?
  • RQ4指针网络机制在ASR解码中处理罕见词或未登录词时是否具有可测量的优势?
  • RQ5上下文语言模型是否可独立于声学模型进行训练,从而实现无需重新训练ASR系统即可模块化改进语言模型?

主要发现

  • 混合指针网络在所有语言模型变体中实现了最低的困惑度,优于LSTM、缓存LSTM和注意力模型。
  • 在英文测试集上,混合指针网络将WER分别降低了14.5%(纯净)、21.3%(嘈杂)和27.6%(极端),相比首次解码的相对提升最高达2%。
  • 在西班牙语中,该方法实现了12.6%(纯净)、14.5%(嘈杂)和20.8%(极端)的WER,表明在不同语言和噪声条件下均具有一致的性能提升。
  • 当元数据与转录文本之间的共现词数增加时,混合指针网络的相对WER降低(WERR)最为显著,表明在高质量元数据条件下性能增益更强。
  • 注意力模型和LSTM变体相比基线仅带来微小改进,但混合指针网络始终表现更优,尤其在高共现场景下。
  • 即使在测试数据中大部分缺乏元数据的情况下(例如,1203个英文纯净测试样本中有78个无元数据),该方法仍保持有效性,表明其对元数据部分缺失具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。