[论文解读] Self-supervised Learning for Speech Enhancement
本文提出了一种用于单通道语音增强的自监督学习框架,该框架在干净语音和含噪混合语音上进行训练,无需成对的干净-含噪标签。通过在分别针对干净语音和含噪混合语音训练的自编码器之间共享潜在表征,模型能够自主地将含噪输入映射为干净输出,在包括混响房间和街道噪声在内的多样化噪声环境中,性能持续优于谱减法。
Supervised learning for single-channel speech enhancement requires carefully labeled training examples where the noisy mixture is input into the network and the network is trained to produce an output close to the ideal target. To relax the conditions on the training data, we consider the task of training speech enhancement networks in a self-supervised manner. We first use a limited training set of clean speech sounds and learn a latent representation by autoencoding on their magnitude spectrograms. We then autoencode on speech mixtures recorded in noisy environments and train the resulting autoencoder to share a latent representation with the clean examples. We show that using this training schema, we can now map noisy speech to its clean version using a network that is autonomously trainable without requiring labeled training examples or human intervention.
研究动机与目标
- 为解决监督语音增强方法依赖昂贵的成对干净-含噪训练数据的局限性。
- 实现在真实世界噪声环境中无需人工标注目标的语音增强模型自主训练。
- 探索使用未配对的干净语音和含噪混合语音数据进行语音去噪的自监督表征学习。
- 开发一种方法,使其在无需微调或访问干净测试混合语音的情况下,泛化至未见的测试条件。
- 在包含混响和非平稳街道噪声等多样噪声类型的现实世界数据集上评估该方法。
提出的方法
- 在干净语音的幅度谱图上训练干净语音自编码器(CAE),以学习共享的潜在表征。
- 使用与CAE相同的潜在空间,在含噪语音混合信号上训练混合信号自编码器(MAE),从而实现跨域映射。
- 采用掩码自编码器(MAE)架构,结合1D转置卷积和softplus激活函数,从掩码输入块重建谱图。
- 应用EQ归一化和批量归一化层以稳定训练并提升表征质量。
- 利用共享潜在空间在推理阶段将含噪输入映射为干净输出,测试过程中无需真实干净目标。
- 以谱减法作为基线模型,并使用PESQ、CSIG、CBAK和COVL指标评估感知质量和可懂度。
实验结果
研究问题
- RQ1自监督学习能否在无需成对干净-含噪训练数据的情况下实现语音增强?
- RQ2该模型在未见的测试条件和说话人身份下的泛化能力如何?
- RQ3增加训练中纯噪声样本的比例是否能提升对多样化噪声类型的鲁棒性?
- RQ4通过共享表征学习,模型能否隐式地实现混响抑制?
- RQ5在非平稳噪声环境中,性能如何随信噪比(SNR)变化?
主要发现
- 所提出的自监督语音增强(SSE)模型在DAPS数据集上所有指标上均持续优于谱减法,PESQ、CSIG、CBAK和COVL指标均有提升。
- 随着训练中纯噪声录音比例的增加,性能提升,表明对多样化噪声类型的泛化能力增强。
- 在BBC Sound Effects数据集的高信噪比条件(10 dB)下,模型取得显著性能提升,尤其在非平稳街道噪声中表现更优。
- 非正式听感测试表明,该模型还能减少混响,暗示其在混响抑制任务中具有应用潜力。
- 模型可泛化至未见的说话人和语音样本,因训练集与测试集在说话人和语料上完全不重叠。
- 共享潜在空间使模型能够有效实现从含噪混合信号到干净语音的映射,而无需标注样本或人工干预。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。