Skip to main content
QUICK REVIEW

[论文解读] Deep context: end-to-end contextual speech recognition

Golan Pundak, Tara N. Sainath|arXiv (Cornell University)|Aug 7, 2018
Speech Recognition and Synthesis参考文献 19被引用 9
一句话总结

本文提出 Contextual-LAS(CLAS),一种端到端神经自动语音识别(ASR)模型,通过联合优化语音识别与上下文短语的嵌入表示,实现实时、上下文感知的转录,无需外部重排序。在 OOV(未登录词)密集的数据集上,CLAS 相较于传统浅层融合方法,相对 WER 最多降低 68%,同时支持未登录词,并消除超参数调优的需要。

ABSTRACT

In automatic speech recognition (ASR) what a user says depends on the particular context she is in. Typically, this context is represented as a set of word n-grams. In this work, we present a novel, all-neural, end-to-end (E2E) ASR sys- tem that utilizes such context. Our approach, which we re- fer to as Contextual Listen, Attend and Spell (CLAS) jointly- optimizes the ASR components along with embeddings of the context n-grams. During inference, the CLAS system can be presented with context phrases which might contain out-of- vocabulary (OOV) terms not seen during training. We com- pare our proposed system to a more traditional contextualiza- tion approach, which performs shallow-fusion between inde- pendently trained LAS and contextual n-gram models during beam search. Across a number of tasks, we find that the pro- posed CLAS system outperforms the baseline method by as much as 68% relative WER, indicating the advantage of joint optimization over individually trained components. Index Terms: speech recognition, sequence-to-sequence models, listen attend and spell, LAS, attention, embedded speech recognition.

研究动机与目标

  • 解决传统 ASR 系统依赖独立训练的语言模型及外部重排序来实现上下文整合的局限性。
  • 开发一种端到端、全神经网络框架,联合优化声学、语言和上下文组件,以提升性能。
  • 在无需训练时预先知晓上下文短语的情况下,实现对上下文感知语音识别中未登录词(OOV)的有效识别。
  • 克服在处理大量上下文短语时的可扩展性问题,因为标准注意力机制的上下文建模会因短语数量增加而性能下降。

提出的方法

  • CLAS 在 Listen, Attend and Spell(LAS)架构基础上,引入一个上下文编码器,利用共享的嵌入层将输入的上下文短语编码为固定维度的向量。
  • 上下文嵌入通过注意力机制处理,该机制在每个解码步骤中关注上下文表示,动态调节解码器的预测结果。
  • 模型通过联合目标函数进行端到端训练,同时优化 ASR 和上下文建模任务,使系统能够学习上下文相关的表示,而无需外部重排序。
  • 为提升可扩展性,本文提出偏差条件化(bias-conditioning)方法,将上下文短语拆分为前缀和后缀,减少唯一上下文片段的数量,降低嵌入相关性。
  • 在推理阶段支持可变长度的上下文短语,并通过子词单元学习未登录词的表示,从而实现对 OOV 词的处理。
  • 通过将上下文直接整合到模型的注意力机制中,避免了对重排序权重的手动调优。

实验结果

研究问题

  • RQ1端到端神经模型能否比传统浅层融合方法更有效地联合优化语音识别与上下文感知语言建模?
  • RQ2在存在未登录词的情况下,联合训练的上下文感知 ASR 模型性能如何随上下文短语数量的增加而变化?
  • RQ3当上下文短语数量极大时,基于注意力机制的上下文建模存在哪些局限性,如何缓解?
  • RQ4偏差条件化技术能否在不损失准确率的前提下提升上下文感知 ASR 模型的可扩展性?

主要发现

  • 在 OOV 率较高的 Songs 和 Contacts 测试集上,CLAS 相较于传统 LAS + OTF 重排序基线,相对 WER 最多降低 68%。
  • 在 Songs 测试集上,CLAS 的 WER 为 6.9%,而 LAS + OTF 重排序为 9.4%,在 OOV 密集场景下表现显著提升。
  • 在包含数千个上下文短语的 Talk-To 测试集上,标准 CLAS 因上下文嵌入间高度相关性而性能下降,WER 达到 14%。
  • 通过偏差条件化,唯一上下文片段数从 3,255 减少至 225,同时总短语片段数仅增加 10%,显著提升了可扩展性。
  • 将偏差条件化与 OTF 重排序结合后,Talk-To 测试集的 WER 降低至 5.6%,优于单独使用 CLAS 或 LAS + OTF 的基线模型。
  • 消融实验表明,偏差条件化与 OTF 重排序均能独立提升 CLAS 性能,两者结合时提升效果最强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。