Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Deep Learning-Based Speech Denoising

Nasim Alamdari, Arian Azarang|arXiv (Cornell University)|Apr 26, 2019
Speech and Audio Processing参考文献 34被引用 8
一句话总结

本文提出了一种用于语音去噪的自监督深度学习方法,通过端到端训练全卷积神经网络,将含噪语音映射到另一版本的含噪语音,从而在训练过程中无需使用干净语音。该方法在三个语音数据集和一个噪声数据集上均优于完全监督的基线模型,在仅能获取含噪数据的真实场景中表现出更优的性能。

ABSTRACT

This paper presents a self-supervised deep neural network solution to speech denoising by easing the requirement that clean speech signals need to be available for network training. This self-supervised approach is based on training a Fully Convolutional Neutral Network to map a noisy speech signal to another noisy version of the speech signal. To show the effectiveness of the developed approach, four commonly used objective performance measures are used to compare the self-supervised approach to the commonly used fully-supervised approach in which it is assumed that clean speech signals are available for training. The measures are examined for three public domain datasets of speech signals and one public domain dataset of noise signals. The results obtained indicate the self-supervised approach outperforms the fully-supervised approach. This solution is more suited for field deployment compared to the conventional deep learning-based solutions since under realistic audio conditions the only signals which are available for training are noisy speech signals and not clean speech signals.

研究动机与目标

  • 为解决在真实场景中缺乏干净语音数据时训练语音去噪模型的挑战。
  • 开发一种自监督深度神经网络,通过将含噪输入映射到其他含噪版本来学习去噪,避免依赖成对的干净数据。
  • 使用标准客观指标在多个公开数据集上评估自监督方法相对于完全监督方法的性能。
  • 证明所提出方法在仅能获取含噪语音信号的现场部署中的实际可行性。

提出的方法

  • 采用自监督方式训练全卷积神经网络,以预测输入含噪语音信号的变换版本。
  • 训练目标基于对比学习,网络学习重建或预测输入信号的含噪变体,从而促进鲁棒特征学习。
  • 模型仅在含噪语音数据上进行训练,训练过程中无需成对的干净语音样本。
  • 使用四种标准客观指标(PESQ、STOI、SNR 和 SI-SDR)在三个公开语音数据集和一个噪声数据集上评估性能。
  • 将自监督模型与在成对干净和含噪语音上训练的完全监督基线模型进行直接比较。

实验结果

研究问题

  • RQ1当训练过程中不使用干净语音数据时,自监督深度学习模型能否在语音去噪性能上优于完全监督模型?
  • RQ2与监督基线相比,自监督方法在多样化的现实世界语音和噪声数据集上的表现如何?
  • RQ3自监督在多大程度上可以减少语音去噪应用中对成对干净语音数据的依赖?
  • RQ4在仅能获取含噪音频的现实世界部署中,自监督方法是否更具适用性?

主要发现

  • 在测试数据集的所有四个客观性能指标上,自监督方法均优于完全监督基线模型。
  • 该方法在PESQ、STOI、SNR和SI-SDR方面均取得更优结果,表明语音质量与可懂度得到提升。
  • 该方法在三个公开语音数据集和一个噪声数据集上表现出强大的泛化能力,证实其对多样化声学条件的鲁棒性。
  • 结果验证了仅在含噪数据上进行自监督训练,即可获得优于需要干净数据的监督训练的去噪性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。