[论文解读] Unsupervised Domain Adaptation by Adversarial Learning for Robust Speech Recognition
本文提出了一种用于语音识别的无监督域自适应方法,通过对抗学习提升对远场、噪声和混响录音条件的鲁棒性。通过联合训练一个具有域判别器和梯度反转的深度神经网络(DNN),模型从无转录的目标数据中学习域不变特征,在意大利语SPEECON数据上实现了19.8%的相对WER降低,在法语适应数据上实现了12.6%的降低,表明该方法在跨语言设置下依然有效。
In this paper, we investigate the use of adversarial learning for unsupervised adaptation to unseen recording conditions, more specifically, single microphone far-field speech. We adapt neural networks based acoustic models trained with close-talk clean speech to the new recording conditions using untranscribed adaptation data. Our experimental results on Italian SPEECON data set show that our proposed method achieves 19.8% relative word error rate (WER) reduction compared to the unadapted models. Furthermore, this adaptation method is beneficial even when performed on data from another language (i.e. French) giving 12.6% relative WER reduction.
研究动机与目标
- 为了提升自动语音识别在未见录音条件下的鲁棒性,特别是单麦克风远场语音识别。
- 为了研究在清洁近讲语音上训练的声学模型,使用对抗学习进行无监督域自适应。
- 为了评估该方法在同语种和跨语种设置下的有效性,特别是针对低资源语言。
- 为了确定使用不同语言的无转录数据进行适应是否仍能带来显著的WER改进。
- 为了评估适应数据量变化对模型性能的影响。
提出的方法
- 该方法使用一个具有共享低层(特征提取器)和任务特定头(用于音素分类和域分类)的深度神经网络(DNN)。
- 在适应阶段,模型在混合数据上进行微调:包括有标签的清洁语音(源域)和无标签的远场语音(目标域)。
- 训练一个域判别器以判断输入特征来自源域还是目标域,并通过梯度反转层(GRL)反转梯度,以促进域不变性。
- 损失函数结合了音素分类的交叉熵损失和域判别任务的对抗损失,通过反向传播联合优化。
- 梯度反转系数 $\lambda$ 控制任务准确率与域不变性之间的权衡,最优值通过实验确定。
- 特征层索引 $f$ 决定在哪个层应用梯度反转,影响所学习的域不变性的程度。
实验结果
研究问题
- RQ1无监督域自适应能否在无转录数据的情况下提升远场语音识别的ASR性能?
- RQ2当适应数据来自不同语言(跨语言设置)时,该方法的有效性如何?
- RQ3无转录适应数据量的变化对WER降低有何影响?
- RQ4超参数 $\lambda$(梯度反转系数)和 $f$(特征层索引)如何影响适应性能?
- RQ5该方法是否能泛化到适应数据中未包含的多样化录音条件?
主要发现
- 在从清洁近讲语音到远场条件的适应中,该方法在意大利语SPEECON数据上实现了19.8%的相对词错误率(WER)降低。
- 即使使用法语适应数据(不同语言),该方法仍实现了12.6%的相对WER降低,证明了其在跨语言场景下的有效性。
- 最佳性能在 $\lambda = 2.0$ 和 $f = 2$ 时达到,125小时Channel 4数据的WER为68.3%。
- 当适应数据量从125小时减少到30小时时,WER仅增加1.5%,表明在30小时后收益递减。
- 该方法对多样化录音条件表现出鲁棒性,即使在非相同语言的适应数据下也观察到性能提升。
- 结果表明,模型学习的是通用的域不变特征,而非对适应集中特定录音条件的过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。