[论文解读] Adapting GPT, GPT-2 and BERT Language Models for Speech Recognition
本文提出一种新颖方法,将双向语言模型(如 BERT)的输出转换为自动语音识别(ASR)中数学上精确的句子先验概率,从而实现 BERT 与单向模型(如 GPT 和 GPT-2)的有效结合。该方法通过结合微调后的 GPT、GPT-2 和 BERT,在 AMI 数据集上实现了高达 12% 相对和 3% 相对的词错误率(WER)降低,最佳性能来自采用优化上下文处理与概率转换的混合模型。
Language models (LMs) pre-trained on massive amounts of text, in particular bidirectional encoder representations from Transformers (BERT), generative pre-training (GPT), and GPT-2, have become a key technology for many natural language processing tasks. In this paper, we present results using fine-tuned GPT, GPT-2, and their combination for automatic speech recognition (ASR). Unlike unidirectional LM GPT and GPT-2, BERT is bidirectional whose direct product of the output probabilities is no longer a valid language prior probability. A conversion method is proposed to compute the correct language prior probability based on bidirectional LM outputs in a mathematically exact way. Experimental results on the widely used AMI and Switchboard ASR tasks showed that the combination of the fine-tuned GPT and GPT-2 outperformed the combination of three neural LMs with different architectures trained from scratch on the in-domain text by up to a 12% relative word error rate reduction (WERR). Furthermore, on the AMI corpus, the proposed conversion for language prior probabilities enables BERT to obtain an extra 3% relative WERR, and the combination of BERT, GPT and GPT-2 results in further improvements.
研究动机与目标
- 在领域内数据上对预训练的单向语言模型(GPT、GPT-2)和双向模型(BERT)进行微调,以适应自动语音识别(ASR)任务。
- 解决直接将 BERT 输出概率相乘无法生成有效句子先验概率的问题,因为其依赖双向上下文。
- 开发一种数学上精确的方法,将双向语言模型的输出转换为 ASR 解码中有效的语言先验概率。
- 评估结合单向和双向语言模型在重打分 ASR 假设中的性能,并改善词错误率(WER)。
- 证明微调后的预训练模型在仅使用领域内数据训练的神经语言模型之上表现更优。
提出的方法
- 提出一种基于公式 (7) 的新颖概率转换方法,从 BERT 的双向输出中计算出精确的句子先验概率,确保数学正确性。
- 将该转换方法应用于微调后的 BERT,使其可作为语言先验集成到 ASR 解码流程中。
- 利用 100 个最佳假设列表中的左、右上下文(LC 和 RC),并可选地使用参考转录文本,以增强 BERT 的概率估计上下文。
- 采用多模型重打分策略,结合微调后的 GPT、GPT-2 和 BERT,模型权重通过线性插值(α = 0.7)进行调整。
- 使用 1-best 假设缓存作为 BERT 的左文,而未来上下文则通过 1-best 或参考转录文本建模。
- 在解码器中采用多头注意力机制,结合掩码自注意力机制以实现单向模型(GPT、GPT-2)的建模,而在编码器中对 BERT 使用完整的自注意力机制。
实验结果
研究问题
- RQ1微调后的 GPT 和 GPT-2 模型是否能在 ASR 中超越仅在领域内数据上从零训练的神经语言模型?
- RQ2是否能够将类似 BERT 的双向语言模型输出概率转换为 ASR 中数学上有效的句子先验概率?
- RQ3与单向模型相比,BERT 中包含过去和未来双向上下文是否能提升 ASR 性能?
- RQ4在 ASR 重打分中,集成单向模型(GPT、GPT-2)和双向模型(BERT)的最佳组合策略是什么?
- RQ5使用参考转录文本作为未来上下文是否能提升基于 BERT 的语言先验在 ASR 中的质量?
主要发现
- 在 AMI 评估集上,微调后的 GPT 和 GPT-2 模型组合相比 4-gram 基线,WER 最多降低 12% 相对。
- 在 AMI 语料上,所提出的概率转换方法使 BERT 相较于基线方法实现了 3% 相对 WER 降低,证明了其有效性。
- 使用 50 个词的左文和 20 个词的右文(使用 1-best 假设)时,所提方法(M=2)在 ADev 上达到最低 WER 17.0%,在 AEval 上为 16.9%。
- 将 1-best 右文替换为参考转录文本(20 个未来词)后,WER 进一部降低至 ADev 的 16.8% 和 AEval 的 16.7%,表明更高品质未来上下文的益处。
- 微调后的 GPT、GPT-2 和 BERT 的组合在 ADev 上实现最低 WER 15.9%,在 AEval 上为 15.5%,优于任何单一模型或双模型组合。
- 所提方法在 M=2 且采用最优上下文长度时,相比最佳 MMLM 基线,WER 绝对降低 0.2%,证明其在处理双向上下文方面的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。