Skip to main content
QUICK REVIEW

[论文解读] PoCoNet: Better Speech Enhancement with Frequency-Positional Embeddings, Semi-Supervised Conversational Data, and Biased Loss

Umut Isik, Ritwik Giri|arXiv (Cornell University)|Aug 10, 2020
Speech and Audio Processing被引用 6
一句话总结

PoCoNet 通过频域位置嵌入实现更优的频域感知特征学习,结合对话数据的半监督训练以提升真实场景下的鲁棒性,并采用偏向性 L1 损失以优先保证语音质量。该方法在 2020 年 Deep Noise Suppression Challenge 的非实时赛道中获得第一名,达到最先进性能。

ABSTRACT

Neural network applications generally benefit from larger-sized models, but for current speech enhancement models, larger scale networks often suffer from decreased robustness to the variety of real-world use cases beyond what is encountered in training data. We introduce several innovations that lead to better large neural networks for speech enhancement. The novel PoCoNet architecture is a convolutional neural network that, with the use of frequency-positional embeddings, is able to more efficiently build frequency-dependent features in the early layers. A semi-supervised method helps increase the amount of conversational training data by pre-enhancing noisy datasets, improving performance on real recordings. A new loss function biased towards preserving speech quality helps the optimization better match human perceptual opinions on speech quality. Ablation experiments and objective and human opinion metrics show the benefits of the proposed improvements.

研究动机与目标

  • 在多样化真实场景下,提升大型神经网络在语音增强任务中的鲁棒性与主观语音质量。
  • 通过半监督方法从真实录音中提取干净语音,以弥补公开数据集中对话语音数据的不足。
  • 通过感知偏向的损失函数,缩小客观损失函数与人类对语音质量感知之间的差距。
  • 通过在 2D U-Net 架构中引入频域位置嵌入,增强网络浅层的特征学习能力。
  • 通过大规模数据增强(包括合成混响和多条件训练)提升模型泛化能力。

提出的方法

  • PoCoNet 采用六层 2D U-Net 结构,结合 DenseNet 块与自注意力机制,并引入频域位置嵌入,以实现早期频域感知的特征学习。
  • 采用半监督方法,利用在 LibriSpeech 上预训练的模型对噪声 VoxCeleb2 数据进行预增强,提取用于训练的干净对话语音。
  • 模型采用多分量损失函数:在幅度谱上使用偏向性 L1 损失,惩罚低估并强调高频成分;同时在波形域使用 L1 损失,通过 STFT 和复数乘法反向传播。
  • 数据增强包括使用真实与合成的房间脉冲响应进行合成混响,以及分别训练具备与不具部分去混响能力的模型。
  • 网络处理 STFT 输入并输出复数比值掩码,推理时使用 40ms 帧长与一帧前瞻以减少伪影。
  • 超参数采用默认合理值,包括损失权重 λ_fg=2.0, λ_bg=0.4, λ_audio=1, λ_spectral=1.5, λ_over=2.6, λ_under=13.3(偏向性谱损失)

实验结果

研究问题

  • RQ1频域位置嵌入是否能提升 2D U-Net 浅层在语音增强任务中的特征学习能力?
  • RQ2在对话数据上进行半监督训练,能在多大程度上提升模型在真实录音上的鲁棒性?
  • RQ3感知偏向的 L1 损失在对齐模型优化与人类语音质量感知方面有多有效?
  • RQ4结合频域位置嵌入、对话数据与偏向损失是否能在客观与主观指标上产生协同增益?
  • RQ5与基线系统相比,该模型在低信噪比与混响条件下表现如何?

主要发现

  • PoCoNet 在 DNS Challenge 的合成非盲测试集上取得 3.52 的平均意见得分(MOS),显著优于基线(2.95)与噪声参考(3.13)。
  • 在真实录音上,模型取得 3.40 的 MOS,较噪声参考(2.83)与基线(2.64)有显著提升。
  • 消融实验表明,若移除半监督对话数据,真实录音上的 MOS 下降 0.21 分,凸显其在提升鲁棒性中的关键作用。
  • 在合成非混响测试集上,模型取得 PESQ 2.745 与 CSIG 4.080 的成绩,优于 RNNoise 与 DNS Challenge 基线。
  • 偏向损失函数显著提升了主观质量,其移除导致 MOS 下降 0.12 分,CSIG 下降 0.331 分。
  • 该模型在 2020 年 Deep Noise Suppression Challenge 的非实时赛道中荣获第一名,证实其达到最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。