Skip to main content
QUICK REVIEW

[论文解读] A Fully Convolutional Neural Network Approach to End-to-End Speech Enhancement

Frank Longueira, Sam Keene|arXiv (Cornell University)|Jul 20, 2018
Speech and Audio Processing参考文献 12被引用 5
一句话总结

本文提出一种全卷积神经网络(FCN),用于端到端语音增强,直接处理原始音频,跳过频谱图计算并保留相位信息。该模型在混叠噪声下实现稳健的语音分离,并通过微调实现对新说话人的泛化,微调后在-5 dB信噪比下PESQ得分提升至2.283(从1.437提升),WER下降至58.69%(从89.305%下降)。

ABSTRACT

This paper will describe a novel approach to the cocktail party problem that relies on a fully convolutional neural network (FCN) architecture. The FCN takes noisy audio data as input and performs nonlinear, filtering operations to produce clean audio data of the target speech at the output. Our method learns a model for one specific speaker, and is then able to extract that speakers voice from babble background noise. Results from experimentation indicate the ability to generalize to new speakers and robustness to new noise environments of varying signal-to-noise ratios. A potential application of this method would be for use in hearing aids. A pre-trained model could be quickly fine tuned for an individuals family members and close friends, and deployed onto a hearing aid to assist listeners in noisy environments.

研究动机与目标

  • 通过在嘈杂的多人说话环境中增强目标语音,解决鸡尾酒会问题。
  • 开发一种端到端语音增强系统,跳过如频谱图等中间特征提取步骤。
  • 通过直接处理原始音频,保留输出中的相位信息,提升主观感知质量。
  • 通过极少的微调数据实现对新说话人的泛化能力。
  • 通过参数高效、全卷积的架构,实现在助听器上的实时部署。

提出的方法

  • 使用无全连接层的全卷积神经网络(FCN)直接处理16 kHz单声道原始音频。
  • 利用卷积定理将FCN解释为在时域运行的可学习非线性滤波器组。
  • 在不同信噪比下,使用清洁语音(Pamela的旁白)与混响噪声(酒吧和咖啡馆环境)混合的数据进行模型训练。
  • 采用端到端训练,将时域的噪声输入映射为时域的干净输出,无需中间特征工程。
  • 在5分钟的新说话人数据(Tricia)上对预训练模型进行微调,以适应未见过的说话人。
  • 使用时域损失函数以保留相位信息,提升增强语音的主观质量。

实验结果

研究问题

  • RQ1在单一说话人上训练的全卷积神经网络是否能在嘈杂环境中泛化到新说话人?
  • RQ2使用极少的新说话人数据进行微调,对预训练语音增强模型的性能有何影响?
  • RQ3该模型在不同信噪比(SNRs)下保持鲁棒性的程度如何?
  • RQ4与基于频谱图的方法相比,原始音频的端到端处理在相位保留和质量方面是否表现更优?
  • RQ5基于FCN的系统在实时部署中的计算与存储效率如何?

主要发现

  • 在微调后,该模型在新说话人(Tricia)于-5 dB信噪比下的PESQ得分为2.283,相比未微调时的1.437显著提升。
  • 在微调后,新说话人在-5 dB信噪比下的WER下降至58.69%,相比未微调时的89.305%显著降低。
  • 该系统在新噪声环境中泛化良好,在-5 dB至5 dB的信噪比范围内均保持强劲性能。
  • 仅使用5分钟新说话人数据进行微调,即可显著提升性能,接近在相同说话人上训练的模型表现。
  • FCN架构降低了模型复杂度,由于参数更少且无需STFT计算,因而支持实时部署。
  • 主观听音测试证实语音可懂度和质量均得到提升,与客观指标结果一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。