Skip to main content
QUICK REVIEW

[论文解读] Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation

Liang Zheng, Zheshu Song|arXiv (Cornell University)|Jun 14, 2023
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出一种基于语音编辑的数据增强方法,以提升端到端自动语音识别(ASR)中代码切换和命名实体识别(NER)的性能。通过使用基于文本的语音编辑模型对真实语音进行编辑,该方法生成的增强语音比传统的音频拼接或神经TTS方法更具连贯性、多样性和真实性,从而在域内和域外测试集上显著降低了词错误率(WER),并提升了命名实体的召回率与精确率。

ABSTRACT

Recently, end-to-end (E2E) automatic speech recognition (ASR) models have made great strides and exhibit excellent performance in general speech recognition. However, there remain several challenging scenarios that E2E models are not competent in, such as code-switching and named entity recognition (NER). Data augmentation is a common and effective practice for these two scenarios. However, the current data augmentation methods mainly rely on audio splicing and text-to-speech (TTS) models, which might result in discontinuous, unrealistic, and less diversified speech. To mitigate these potential issues, we propose a novel data augmentation method by applying the text-based speech editing model. The augmented speech from speech editing systems is more coherent and diversified, also more akin to real speech. The experimental results on code-switching and NER tasks show that our proposed method can significantly outperform the audio splicing and neural TTS based data augmentation systems.

研究动机与目标

  • 为解决因数据稀缺及罕见词汇的长尾分布,导致端到端ASR模型在代码切换和命名实体识别任务上表现不佳的问题。
  • 通过减少现有数据增强技术(音频拼接与神经TTS)在音质不连续性、伪影及合成语音多样性不足方面的局限,提升性能。
  • 通过生成更具真实感与连贯性的增强训练数据,提升模型在未见代码切换与命名实体语音上的泛化能力与鲁棒性。
  • 在真实ASR场景中,评估基于语音编辑的数据增强方法在代码切换与NER任务上的有效性。

提出的方法

  • 该方法利用基于文本的语音编辑模型,通过插入或替换目标词汇(如命名实体或代码切换片段)来修改真实语音音频,同时保持原始说话人的语音特征与声学特性。
  • 该方法通过编辑现有真实音频样本生成增强语音,确保语音的连贯性与自然性,与仅通过拼接不连续片段的音频拼接方法形成对比。
  • 该方法生成两种变体:一种为完整音频编辑(Aug_edit),另一种为仅声学特征编辑(Aug_edit-feats),以在真实感与训练效率之间实现权衡。
  • 采用混合数据增强策略,将编辑后的语音与神经TTS生成的语音结合(Aug_edit-feats+tts),以进一步提升多样性并增强泛化能力。
  • 使用增强数据对预训练ASR模型进行微调,冻结编码器的前11层以保持通用语音识别能力,同时适应目标领域。
  • 通过混合真实非目标语音数据,平衡领域偏移问题,并防止模型过度拟合于合成数据。

实验结果

研究问题

  • RQ1基于语音编辑的数据增强方法是否能在端到端ASR中提升代码切换识别性能,优于音频拼接与神经TTS方法?
  • RQ2基于语音编辑的数据增强方法是否能在域内与域外设置下提升命名实体识别性能?
  • RQ3在真实ASR应用中,编辑后语音的连贯性与声学真实性是否优于音频拼接或TTS生成的语音?
  • RQ4将编辑语音与神经TTS生成语音结合,对模型泛化能力与鲁棒性有何影响?

主要发现

  • 所提出的基于语音编辑的数据增强方法(Aug_edit)在域内与域外测试集上均实现了最低的词错误率(WER),并取得了最高的命名实体召回率与精确率,优于音频拼接与神经TTS基线方法。
  • 混合方法(Aug_edit-feats+tts)在所有指标上均表现最佳,包括WER与命名实体识别得分,优于所有其他方法。
  • 使用真实与增强数据混合进行微调显著提升了模型泛化能力,相比仅使用合成数据,有效减少了过拟合现象。
  • Aug_edit-feats变体在WER与命名实体识别性能之间实现了更优平衡,优于Aug_edit、Aug_splice与Aug_tts,因其在未修改区域保持了更好的声学一致性。
  • 结果表明,语音编辑生成的增强语音比音频拼接或神经TTS更具真实感与连贯性,从而在罕见词与未登录词的ASR鲁棒性方面实现了可测量的性能提升。
  • 性能增益在代码切换与命名实体识别任务中均保持一致,验证了该方法在数据稀缺ASR场景中的广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。