[论文解读] Error Correction in ASR using Sequence-to-Sequence Models
本文提出 RoBART,一种通过合成和真实 ASR 错误微调的 BART 模型,用于纠正自动语音识别(ASR)错误。通过利用音素序列并在增强数据上进行自适应训练,该模型在口音语音上显著降低了 WER,但因上下文捕捉能力有限,在语法错误纠正任务上表现不佳。
Post-editing in Automatic Speech Recognition (ASR) entails automatically correcting common and systematic errors produced by the ASR system. The outputs of an ASR system are largely prone to phonetic and spelling errors. In this paper, we propose to use a powerful pre-trained sequence-to-sequence model, BART, further adaptively trained to serve as a denoising model, to correct errors of such types. The adaptive training is performed on an augmented dataset obtained by synthetically inducing errors as well as by incorporating actual errors from an existing ASR system. We also propose a simple approach to rescore the outputs using word level alignments. Experimental results on accented speech data demonstrate that our strategy effectively rectifies a significant number of ASR errors and produces improved WER results when compared against a competitive baseline. We also highlight a negative result obtained on the related grammatical error correction task in Hindi language showing the limitation in capturing wider context by our proposed model.
研究动机与目标
- 解决纠正常见、系统性 ASR 错误(如语音混淆、拼写错误和词边界错误)的挑战。
- 通过生成合成错误数据,克服 ASR 错误纠正任务中监督训练数据不足的问题。
- 通过在 ASR 合理错误上微调预训练的序列到序列模型(BART),提升 ASR 输出质量。
- 在相关语法错误纠正(GEC)任务中评估模型的泛化能力,特别是在印地语中的表现,凸显其局限性。
提出的方法
- 在合成 ASR 错误和真实 ASR 假设的组合上微调预训练的 BART 模型,使其适应基于语音的错误模式。
- 通过应用语音上合理的编辑(如字符删除、替换和词边界移动)对参考转录文本进行处理,生成合成训练数据。
- 将音素序列作为辅助输入,以增强模型检测和纠正语音驱动错误的能力。
- 使用词级对齐对 ASR 系统和 RoBART 模型的输出进行重评分和融合,从而提升最终转录质量。
- 对 mBART 模型进行适配,用于印地语语法错误纠正,采用随机掩码和错误聚焦掩码两种策略。
- 使用口音语音的 WER 和印地语 GEC 数据集的 GLEU 评估性能,与基线模型进行比较。
实验结果
研究问题
- RQ1预训练的序列到序列模型(如 BART)是否可以通过合成和真实错误数据有效微调,以纠正常见的 ASR 错误?
- RQ2将音素序列作为输入,是否能提升 ASR 中的错误纠正性能?
- RQ3所提出的数据增强策略是否能显著降低口音语音数据上的词错误率(WER)?
- RQ4同一模型架构能否泛化到语法错误纠正任务?若不能,原因是什么?
- RQ5上下文感知能力在区分语音错误(ASR)和形态错误(GEC)中起什么作用?
主要发现
- RoBART 模型通过在合成和真实 ASR 错误上微调,显著降低了口音语音数据上的 WER。
- 通过词级对齐和重评分,将 ASR 假设与 RoBART 输出相结合,进一步提升了转录质量。
- 该模型在语音驱动错误(如拼写错误、字符丢失和词边界混淆)上表现良好。
- 在印地语语法错误纠正任务中,基于 mBART 的模型表现不如基线模型,尤其在形态和句法错误上。
- GEC 任务失败的原因在于模型无法捕捉更广泛的上下文依赖关系,尽管其在局部词汇错误上表现强劲。
- 在微调过程中使用错误聚焦掩码并未优于简单随机掩码,表明上下文建模比错误特定掩码更为关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。