[论文解读] Class LM and word mapping for contextual biasing in End-to-End ASR
本文提出一种双管齐下的方法,以提升端到端自动语音识别(ASR)在罕见及用户特定命名实体上的表现:(1)在束搜索过程中注入上下文感知的有限状态转换器(FST),并采用分数归一化技术,将词错误率(WER)降低57%;(2)通过G2P模型将罕见词汇映射到更常见的发音形式,使WER额外降低31%。该方法在命名实体语音输入上实现了70.6%的整体WER降低,同时对普通语音的识别准确率影响极小。
In recent years, all-neural, end-to-end (E2E) ASR systems gained rapid interest in the speech recognition community. They convert speech input to text units in a single trainable Neural Network model. In ASR, many utterances contain rich named entities. Such named entities may be user or location specific and they are not seen during training. A single model makes it inflexible to utilize dynamic contextual information during inference. In this paper, we propose to train a context aware E2E model and allow the beam search to traverse into the context FST during inference. We also propose a simple method to adjust the cost discrepancy between the context FST and the base model. This algorithm is able to reduce the named entity utterance WER by 57% with little accuracy degradation on regular utterances. Although an E2E model does not need pronunciation dictionary, it's interesting to make use of existing pronunciation knowledge to improve accuracy. In this paper, we propose an algorithm to map the rare entity words to common words via pronunciation and treat the mapped words as an alternative form to the original word during recognition. This algorithm further reduces the WER on the named entity utterances by another 31%.
研究动机与目标
- 解决端到端ASR模型在罕见、用户特定命名实体(如联系人和应用名称)上表现不佳的问题。
- 在推理过程中实现端到端ASR的动态上下文偏置,尽管模型本身未显式包含语言模型或发音词典。
- 降低基础模型与上下文FST路径之间的成本差异,以提升束搜索的准确性。
- 通过现有词典将未登录词(OOV)映射到更常见的发音形式,以改善识别可能性。
- 在提升个人化内容识别性能的同时,保持对普通非命名实体语音的高识别准确率。
提出的方法
- 作者使用BPE分词训练LAS-MOCHA模型,并在训练过程中将类别语言模型(Class LM)标签(如@contact#和#contact@)注入转录文本,以标记命名实体边界。
- 在推理阶段,基于用户特定的上下文列表构建加权有限状态转换器(WFST),并将其集成到束搜索中,使模型能够遍历上下文FST路径。
- 采用分数归一化技术,通过缩放因子λc和λb,平衡基础模型路径与上下文FST路径之间的对数概率分数。
- 对于罕见词汇,使用基于双向LSTM的音素转写模型(G2P)生成其发音,并将词汇映射到更常见的音素形式,以提升识别可能性。
- 将映射后的词序列用于构建替代FST路径,该路径与原始上下文FST结合,以增强鲁棒性。
- 通过命名实体和普通语音语料集上的WER评估该方法,并对归一化与词汇映射进行消融实验。
实验结果
研究问题
- RQ1在端到端ASR的束搜索过程中注入用户特定的上下文FST,能否显著降低命名实体语音输入的WER?
- RQ2在基础模型与上下文FST路径之间进行分数归一化,能否在不降低普通语音识别性能的前提下提升识别准确率?
- RQ3基于发音的词汇映射能否通过将罕见或未登录命名实体转换为更常见、更易识别的形式,降低WER?
- RQ4上下文FST注入与词汇映射的联合效应如何?尤其在具有挑战性的命名实体输入上,整体WER降低效果如何?
- RQ5该方法在包含不同数量命名实体的语音输入上表现如何?
主要发现
- 结合分数归一化的上下文FST使用,使命名实体语音输入的WER从18.1%降至9.0%,相对降低50%,相对WER改善达57%。
- 在仅使用原始FST的基础上,加入基于发音的词汇映射后,同一数据集的WER从6.5%降至4.5%,相对于FST基线实现31%的相对降低。
- 当结合两种技术时,命名实体语音输入的整体WER降低达到70.6%,相较于无FST基线。
- 该方法在普通语音输入上的WER仅增加0.1%(从8.4%升至8.5%),表明其在非目标输入上具有极强的鲁棒性。
- 如图1所示,不同数量偏置短语的语音输入中,WER降低效果保持一致,表明方法具有广泛的适用性。
- 表4中的案例验证表明,经过词汇映射后,'Yvanna'和'Vandendriessche'等罕见词汇被正确识别,模型生成了如'ivana'和'vandendraci'的正确转录。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。