[论文解读] Unsupervised Noise Adaptive Speech Enhancement by Discriminator-Constrained Optimal Transport
该论文提出了一种新型的判别器约束最优传输网络(DOTN),用于语音增强中的无监督域自适应,将最优传输理论与生成对抗网络相结合,无需目标数据标签即可对齐不同域中的噪声语音分布。该方法在VoiceBank-DEMAND和TIMIT数据集上实现了最先进性能,在PESQ和STOI评分上均优于现有对抗性域自适应方法,且在目标域复杂度增加时表现出强鲁棒性。
This paper presents a novel discriminator-constrained optimal transport network (DOTN) that performs unsupervised domain adaptation for speech enhancement (SE), which is an essential regression task in speech processing. The DOTN aims to estimate clean references of noisy speech in a target domain, by exploiting the knowledge available from the source domain. The domain shift between training and testing data has been reported to be an obstacle to learning problems in diverse fields. Although rich literature exists on unsupervised domain adaptation for classification, the methods proposed, especially in regressions, remain scarce and often depend on additional information regarding the input data. The proposed DOTN approach tactically fuses the optimal transport (OT) theory from mathematical analysis with generative adversarial frameworks, to help evaluate continuous labels in the target domain. The experimental results on two SE tasks demonstrate that by extending the classical OT formulation, our proposed DOTN outperforms previous adversarial domain adaptation frameworks in a purely unsupervised manner.
研究动机与目标
- 为解决语音增强中训练与测试噪声条件不同的领域偏移问题,这是实际应用中的常见挑战。
- 为语音处理中的回归任务(特别是语音增强)开发一种完全无监督的域自适应方法,无需目标数据标签或领域类型标注。
- 克服现有域自适应方法依赖领域不变特征学习或需要辅助信息(如噪声类型分类)的局限性。
- 评估方法在目标域复杂度增加(如测试集中包含多种噪声类型)时的鲁棒性。
- 证明最优传输与对抗训练的结合可在回归设置中有效实现从源域到目标域的知识迁移。
提出的方法
- 该方法提出一种判别器约束最优传输网络(DOTN),将最优传输(OT)理论与生成对抗网络(GANs)结合,用于语音增强中的无监督域自适应。
- DOTN利用最优传输计算源域干净语音分布与目标域噪声语音之间的最小成本传输计划,以最小化领域偏移。
- 训练一个判别器以区分真实源域干净语音与来自目标域的生成类干净语音,确保输出具有高感知质量。
- 生成器网络通过最小化OT成本并结合判别器的反馈进行正则化,学习从目标域噪声语音到增强后干净语音的映射。
- 训练过程联合优化基于OT的领域对齐与对抗损失,使模型能够泛化到目标域中未见的噪声类型。
- 该框架仅需源域的噪声-干净语音对与目标域的噪声语音,无需目标标签或噪声类型标注。
实验结果
研究问题
- RQ1最优传输能否与对抗训练有效结合,以实现在语音增强等回归任务中的无监督域自适应?
- RQ2与现有对抗性域自适应框架相比,所提出的DOTN方法在PESQ和STOI评分上的表现如何?
- RQ3当目标域包含多种噪声类型时,该方法的性能退化程度如何?是否表现出灾难性遗忘?
- RQ4该方法能否在不依赖额外信息或标签的情况下泛化到目标域中未见的噪声类型?
- RQ5目标域的复杂度(如噪声类型数量)如何影响域自适应系统的性能?
主要发现
- 在VoiceBank-DEMAND数据集上,DOTN的PESQ得分为2.083,STOI得分为0.757,优于DAT(1.400 PESQ,0.569 STOI)和MDAN(1.903 PESQ,0.722 STOI)。
- 在TIMIT数据集上,DOTN的平均PESQ为1.780,STOI为0.690,优于DAT(1.400 PESQ,0.569 STOI)和MDAN(1.766 PESQ,0.670 STOI)。
- 在多种噪声类型(如H+Ca+Cr+B)测试下,PESQ与STOI得分与单噪声类型模型相当,表明灾难性遗忘极小。
- 仅在顺序学习四种噪声类型时观察到性能下降,STOI得分出现中等程度下降,表明对目标域复杂度增加具有鲁棒性。
- 该方法在所有信噪比(SNR)水平和噪声类型下均表现出一致的优越性,证实其在真实世界多样化噪声环境中的有效性。
- 消融研究证实,OT与基于判别器的反馈相结合可显著提升适应性能,优于基线GAN或仅OT方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。