Skip to main content
QUICK REVIEW

[论文解读] Speech denoising by parametric resynthesis

Soumi Maiti, Michael Mandel|arXiv (Cornell University)|Apr 2, 2019
Speech and Audio Processing参考文献 18被引用 4
一句话总结

本文提出了一种基于参数化重合成的语音去噪方法,通过神经网络从含噪输入中预测干净语音声码器参数,再利用声码器重合成高质量、无噪声的语音。该方法在主观质量与可懂度方面达到与理想维纳掩蔽相当的水平,并优于基于深度神经网络的掩蔽预测方法,表明含噪语音中的语调信息可带来优于文本驱动合成的语音质量。

ABSTRACT

This work proposes the use of clean speech vocoder parameters as the target for a neural network performing speech enhancement. These parameters have been designed for text-to-speech synthesis so that they both produce high-quality resyntheses and also are straightforward to model with neural networks, but have not been utilized in speech enhancement until now. In comparison to a matched text-to-speech system that is given the ground truth transcripts of the noisy speech, our model is able to produce more natural speech because it has access to the true prosody in the noisy speech. In comparison to two denoising systems, the oracle Wiener mask and a DNN-based mask predictor, our model equals the oracle Wiener mask in subjective quality and intelligibility and surpasses the realistic system. A vocoder-based upper bound shows that there is still room for improvement with this approach beyond the oracle Wiener mask. We test speaker-dependence with two speakers and show that a single model can be used for multiple speakers.

研究动机与目标

  • 通过利用含噪语音中蕴含的语调信息来提升语音去噪性能,而这些信息在基于文本的TTS系统中会丢失。
  • 解决传统语音增强方法的局限性,如语音过度抑制与噪声抑制不足。
  • 探究是否可将专为高质量合成设计的干净语音声码器参数作为神经网络去噪的有效目标。
  • 将所提方法与现有基线方法(包括理想维纳掩蔽与基于DNN的掩蔽预测)进行性能评估。
  • 探究单一训练模型在多个说话人之间的说话人无关性与泛化能力。

提出的方法

  • 训练神经网络,从含噪的对数梅尔倒谱特征中预测干净语音的声学参数(频谱包络、基频F0、清浊音、准周期能量)。
  • 使用WORLD声码器将干净语音编码为声学参数,并将预测的参数解码回波形,实现高保真度的重合成。
  • 使用预测值与真实值声学特征之间的均方误差损失进行模型训练,特征包括一阶与二阶导数。
  • 采用前馈DNN与LSTM两种架构以建模时序上下文,其中LSTM版本性能更优。
  • 通过预测干净参数并重合成信号,将模型应用于含噪语音,生成无噪声输出。
  • 使用基于声码器的上限作为评估基准,表明该方法在理想维纳掩蔽之上仍有改进空间。

实验结果

研究问题

  • RQ1干净语音声码器参数能否作为神经网络语音去噪的有效目标?
  • RQ2与基于文本的TTS系统相比,利用含噪语音中的语调信息是否能提升语音质量?
  • RQ3在主观质量与可懂度方面,参数化重合成方法与理想维纳掩蔽及基于DNN的掩蔽预测相比表现如何?
  • RQ4单一模型是否无需说话人特定微调即可在多个说话人上实现良好泛化?
  • RQ5该参数化重合成方法的性能上限是多少?与现有方法相比如何?

主要发现

  • 参数化重合成模型在主观语音质量与可懂度方面与理想维纳掩蔽相当,后者可访问干净信号。
  • 该模型在主观质量与可懂度方面均优于基于DNN的掩蔽预测器,PESQ得分为2.43对比2.26,STOI得分为0.87对比0.80。
  • 主观MUSHRA测试确认模型生成无噪声语音,其噪声抑制质量优于理想维纳掩蔽。
  • 该模型在客观指标与主观质量方面均优于标准统计TTS系统,PESQ为2.43对比1.33,STOI为0.87对比0.08。
  • 在多个说话人上联合训练的单一模型在各说话人上均表现优异,证明了良好的说话人无关性。
  • 基于声码器的上限分析表明,该模型在理想维纳掩蔽之上仍有改进空间,提示未来存在进一步优化潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。