Skip to main content
QUICK REVIEW

[论文解读] Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion

Suyoun Kim, Siddharth Dalmia|arXiv (Cornell University)|Jun 27, 2019
Speech Recognition and Synthesis参考文献 44被引用 11
一句话总结

该论文提出了一种门控端到端语音识别模型,通过整合预训练的词(fastText)和句子(BERT)嵌入,以增强多轮对话中的上下文表征。通过使用门控机制融合语音、词和上下文嵌入,该模型在Switchboard上实现了15%的相对WER提升,在CallHome上实现了5%的提升,优于标准的端到端模型在长对话理解方面的表现。

ABSTRACT

We present a novel conversational-context aware end-to-end speech recognizer based on a gated neural network that incorporates conversational-context/word/speech embeddings. Unlike conventional speech recognition models, our model learns longer conversational-context information that spans across sentences and is consequently better at recognizing long conversations. Specifically, we propose to use the text-based external word and/or sentence embeddings (i.e., fastText, BERT) within an end-to-end framework, yielding a significant improvement in word error rate with better conversational-context representation. We evaluated the models on the Switchboard conversational speech corpus and show that our model outperforms standard end-to-end speech recognition models.

研究动机与目标

  • 通过引入多轮对话上下文,提升端到端语音识别在长对话中的表现。
  • 利用预训练的文本嵌入(fastText、BERT)改善语音识别中的上下文表征。
  • 设计一种门控机制,有效融合语音、词和对话上下文嵌入。
  • 探索使用仅文本数据进行联合训练,以提升泛化能力并减少对大规模标注语音数据集的依赖。
  • 评估话语历史长度和采样策略对上下文表征质量的影响。

提出的方法

  • 采用基于CTC/注意力机制的编码器-解码器架构进行端到端语音识别,输出为音素。
  • 将外部预训练的词嵌入和句子嵌入(fastText、BERT)作为解码器的输入,用于上下文建模。
  • 采用上下文门控机制,通过语音、词和上下文嵌入之间的乘法交互,动态加权其贡献。
  • 应用话语级采样策略——从真实转录或模型生成的假设中选择前序话语,以减少过拟合并提升泛化能力。
  • 通过预训练和联合微调,使用语音-转录对和仅文本数据联合训练模型,以增强上下文学习。
  • 使用BERT句子嵌入作为参考,计算对话距离分数,以评估连续假设之间的一致性。

实验结果

研究问题

  • RQ1预训练的文本嵌入(fastText、BERT)是否能改善端到端语音识别中的对话上下文表征?
  • RQ2前序话语的数量和采样策略如何影响上下文感知语音识别的性能?
  • RQ3门控融合机制是否能有效结合语音、词和对话上下文嵌入,从而提升识别准确率?
  • RQ4在标注语音数据有限的情况下,与仅文本数据联合训练在多大程度上能提升模型性能?
  • RQ5与基线模型相比,该模型在相邻话语之间是否更好地保持了对话一致性?

主要发现

  • 与基线端到端模型相比,该模型在Switchboard语料库上实现了15%的相对词错误率(WER)降低。
  • 在CallHome子集上,该模型表现出5%的相对WER改进,证明了在对话语音识别中的一致性增益。
  • 20%的话语采样率(即从前序话语中部分采样自模型输出)在开发集上取得了最佳准确率,表明泛化能力得到提升。
  • 该模型的假设在BERT嵌入相似性度量的对话距离上,相对更接近参考转录,距离减少7.4%,表明上下文一致性更优。
  • 结合外部嵌入(fastText、BERT)与门控机制,相比未集成此类模块的模型,上下文表征显著更优。
  • 该模型在长对话中泛化良好,可扩展至其他上下文敏感的语音任务,如对话系统和情感分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。