Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Domain Adaptation by Adversarial Learning for Robust Speech Recognition

Pavel Denisov, Ngoc Thang Vu|ArXiv.org|Jul 30, 2018
Speech Recognition and Synthesis参考文献 29被引用 9
一句话总结

本文提出了一种用于语音识别的无监督域自适应方法,通过对抗学习提升对远场、噪声和混响录音条件的鲁棒性。通过联合训练一个具有域判别器和梯度反转的深度神经网络(DNN),模型从无转录的目标数据中学习域不变特征,在意大利语SPEECON数据上实现了19.8%的相对WER降低,在法语适应数据上实现了12.6%的降低,表明该方法在跨语言设置下依然有效。

ABSTRACT

In this paper, we investigate the use of adversarial learning for unsupervised adaptation to unseen recording conditions, more specifically, single microphone far-field speech. We adapt neural networks based acoustic models trained with close-talk clean speech to the new recording conditions using untranscribed adaptation data. Our experimental results on Italian SPEECON data set show that our proposed method achieves 19.8% relative word error rate (WER) reduction compared to the unadapted models. Furthermore, this adaptation method is beneficial even when performed on data from another language (i.e. French) giving 12.6% relative WER reduction.

研究动机与目标

  • 为了提升自动语音识别在未见录音条件下的鲁棒性,特别是单麦克风远场语音识别。
  • 为了研究在清洁近讲语音上训练的声学模型,使用对抗学习进行无监督域自适应。
  • 为了评估该方法在同语种和跨语种设置下的有效性,特别是针对低资源语言。
  • 为了确定使用不同语言的无转录数据进行适应是否仍能带来显著的WER改进。
  • 为了评估适应数据量变化对模型性能的影响。

提出的方法

  • 该方法使用一个具有共享低层(特征提取器)和任务特定头(用于音素分类和域分类)的深度神经网络(DNN)。
  • 在适应阶段,模型在混合数据上进行微调:包括有标签的清洁语音(源域)和无标签的远场语音(目标域)。
  • 训练一个域判别器以判断输入特征来自源域还是目标域,并通过梯度反转层(GRL)反转梯度,以促进域不变性。
  • 损失函数结合了音素分类的交叉熵损失和域判别任务的对抗损失,通过反向传播联合优化。
  • 梯度反转系数 $\lambda$ 控制任务准确率与域不变性之间的权衡,最优值通过实验确定。
  • 特征层索引 $f$ 决定在哪个层应用梯度反转,影响所学习的域不变性的程度。

实验结果

研究问题

  • RQ1无监督域自适应能否在无转录数据的情况下提升远场语音识别的ASR性能?
  • RQ2当适应数据来自不同语言(跨语言设置)时,该方法的有效性如何?
  • RQ3无转录适应数据量的变化对WER降低有何影响?
  • RQ4超参数 $\lambda$(梯度反转系数)和 $f$(特征层索引)如何影响适应性能?
  • RQ5该方法是否能泛化到适应数据中未包含的多样化录音条件?

主要发现

  • 在从清洁近讲语音到远场条件的适应中,该方法在意大利语SPEECON数据上实现了19.8%的相对词错误率(WER)降低。
  • 即使使用法语适应数据(不同语言),该方法仍实现了12.6%的相对WER降低,证明了其在跨语言场景下的有效性。
  • 最佳性能在 $\lambda = 2.0$ 和 $f = 2$ 时达到,125小时Channel 4数据的WER为68.3%。
  • 当适应数据量从125小时减少到30小时时,WER仅增加1.5%,表明在30小时后收益递减。
  • 该方法对多样化录音条件表现出鲁棒性,即使在非相同语言的适应数据下也观察到性能提升。
  • 结果表明,模型学习的是通用的域不变特征,而非对适应集中特定录音条件的过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。