[论文解读] Cross-Utterance Language Models with Acoustic Error Sampling
本文提出了一种跨话语语言模型(CULM),通过使用基于LSTM的提取网络,结合前后话语的上下文信息,以提升自动语音识别(ASR)性能。该方法采用最终状态编码或自注意力编码方式,将上下文信息整合到语言模型中。此外,引入了语音错误采样技术,以缓解训练与测试之间的不匹配问题,在AMI、Switchboard和Callhome评估集上分别实现了0.6%、0.3%和0.9%的绝对WER降低,优于基线LSTM语言模型。
The effective exploitation of richer contextual information in language models (LMs) is a long-standing research problem for automatic speech recognition (ASR). A cross-utterance LM (CULM) is proposed in this paper, which augments the input to a standard long short-term memory (LSTM) LM with a context vector derived from past and future utterances using an extraction network. The extraction network uses another LSTM to encode surrounding utterances into vectors which are integrated into a context vector using either a projection of LSTM final hidden states, or a multi-head self-attentive layer. In addition, an acoustic error sampling technique is proposed to reduce the mismatch between training and test-time. This is achieved by considering possible ASR errors into the model training procedure, and can therefore improve the word error rate (WER). Experiments performed on both AMI and Switchboard datasets show that CULMs outperform the LSTM LM baseline WER. In particular, the CULM with a self-attentive layer-based extraction network and acoustic error sampling achieves 0.6% absolute WER reduction on AMI, 0.3% WER reduction on the Switchboard part and 0.9% WER reduction on the Callhome part of Eval2000 test set over the respective baselines.
研究动机与目标
- 通过利用当前话语前后话语的上下文信息,提升自动语音识别(ASR)性能。
- 解决在跨话语语言建模中,训练阶段(使用参考转录)与推理阶段(使用ASR假设)之间的不匹配问题。
- 通过一种新颖的数据增强技术,提升语言模型对ASR错误的泛化能力与鲁棒性。
- 在联合训练框架下,评估不同上下文向量提取方法——最终状态编码与自注意力编码——的有效性。
提出的方法
- CULM架构将主LSTM语言模型与一个上下文提取网络相结合,后者通过辅助LSTM编码器将相邻话语编码为上下文向量。
- 上下文向量通过两种方式生成:(1) 将每个话语段的编码器LSTM最终隐藏状态拼接后,通过全连接层投影;(2) 在整个编码器输出序列上应用多头自注意力层,再进行投影。
- 主LSTM将上下文向量作为辅助输入,与词嵌入和隐藏状态拼接,以预测下一个词的概率分布。
- 模型通过交叉熵损失进行端到端联合训练,实现主语言模型与上下文提取组件的联合优化。
- 通过在训练过程中向上下文话语中注入模拟的ASR错误(替换、插入、删除),引入语音错误采样技术,以模拟真实解码条件。
- 错误分布基于ASR系统输出的分析文件推导得出,使采样更具真实感与有效性。
实验结果
研究问题
- RQ1将相邻话语的上下文信息纳入建模,是否能超越标准自回归语言模型的性能上限?
- RQ2使用自注意力层进行上下文向量融合,是否在捕捉跨话语依赖关系方面优于简单的最终状态编码?
- RQ3语音错误采样在多大程度上缓解了在跨话语建模中,训练阶段(使用真实转录)与推理阶段(使用假设转录)之间的差异?
- RQ4所提方法在不同对话语料库上的泛化能力如何,特别是在多样化测试集上的WER降低表现?
主要发现
- 采用自注意力上下文编码与语音错误采样的CULM在AMI评估集上相比基线LSTM语言模型,实现了0.6%的绝对WER降低。
- 在Eval2000测试集的Switchboard部分,最佳系统相比基线实现了0.3%的绝对WER降低。
- 在Eval2000测试集的Callhome部分,所提方法实现了0.9%的绝对WER降低,表明其在更具挑战性的自然口语数据上表现优异。
- 语音错误采样技术提升了泛化能力,即使在使用真实上下文的情况下,自注意力CULM仍优于无采样基线,显示出数据增强效应。
- 错误分析显示,模型通过关注相关上下文词,有效纠正了时态不一致、词语重复和代词一致性错误,尤其在使用自注意力机制时效果更明显。
- 伪困惑度(PPL)结果一致显示性能提升:最佳系统在AMI上达到55.3的伪PPL,在Callhome上达到16.9的WER,表明语言建模与解码性能更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。