Skip to main content
QUICK REVIEW

[论文解读] Domain Adversarial Training for Accented Speech Recognition

Sining Sun, Ching-Feng Yeh|arXiv (Cornell University)|Jun 7, 2018
Speech Recognition and Synthesis参考文献 11被引用 15
一句话总结

本文提出领域对抗性训练(DAT)以在无需转录的带口音语音数据的情况下,通过学习口音不变特征来提升带口音语音识别性能。通过使用对抗性领域分类器最小化口音特异性差异来训练基于TDNN的声学模型,DAT在普通话口音上实现了高达7.45%的相对字符错误率降低,优于多任务学习,并且即使与自动转录结合使用也表现更优。

ABSTRACT

In this paper, we propose a domain adversarial training (DAT) algorithm to alleviate the accented speech recognition problem. In order to reduce the mismatch between labeled source domain data ("standard" accent) and unlabeled target domain data (with heavy accents), we augment the learning objective for a Kaldi TDNN network with a domain adversarial training (DAT) objective to encourage the model to learn accent-invariant features. In experiments with three Mandarin accents, we show that DAT yields up to 7.45% relative character error rate reduction when we do not have transcriptions of the accented speech, compared with the baseline trained on standard accent data only. We also find a benefit from DAT when used in combination with training from automatic transcriptions on the accented data. Furthermore, we find that DAT is superior to multi-task learning for accented speech recognition.

研究动机与目标

  • 解决由于转录数据有限而导致的低资源带口音语音识别挑战。
  • 减少端到端ASR系统中标准语音与带口音语音之间的领域差异。
  • 开发一种利用大量未标注带口音语音数据的无监督自适应方法。
  • 在低资源设置下,将DAT与多任务学习及有监督自适应方法进行比较。
  • 评估DAT在多种普通话口音(严重程度各不相同)下的有效性。

提出的方法

  • 在基于Kaldi的TDNN声学模型中增加一个领域分类器,以区分标准语音与带口音语音。
  • 使用联合目标函数进行模型训练:标准ASR损失(交叉熵和MMI)与领域对抗损失。
  • 使用梯度反转,将来自领域分类器的对抗性信号反向传播至共享特征提取器,以鼓励学习领域不变表示。
  • 利用共享网络提取的特征表示,训练领域分类器以预测口音类型(标准 vs. 带口音)。
  • 在多口音和特定口音自适应设置下应用该方法,使用600小时未标注的普通话带口音语音数据。
  • 将λ = 0.03作为ASR与领域对抗目标之间最优权衡超参数。

实验结果

研究问题

  • RQ1在无需转录带口音语音数据的情况下,领域对抗性训练是否能降低带口音语音识别的字符错误率?
  • RQ2当将标准ASR模型自适应到带口音语音时,DAT与多任务学习相比表现如何?
  • RQ3将DAT与带口音语音的自动转录结合使用会产生何种影响?
  • RQ4使用DAT进行特定口音自适应是否优于多口音自适应?
  • RQ5DAT在不同严重程度的普通话口音中的表现如何变化?

主要发现

  • 当未提供带口音语音的转录数据时,DAT在普通话口音上实现了高达7.45%的相对字符错误率降低。
  • 在特定口音自适应中,与标准模型相比,DAT分别将SC、HN和FJ口音的CER降低了5.8%、7.4%和3.1%。
  • DAT始终优于多任务学习,后者有时因学习口音区分性特征而造成性能下降。
  • 与自动转录结合使用时,DAT带来了额外20%的整体CER降低,表明其具有互补优势。
  • 当提供人工转录时,DAT的性能增益减小,表明其主要价值在于无监督自适应。
  • 最优权衡超参数λ被确定为0.03,可在ASR准确率与领域不变性之间实现平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。