Skip to main content
QUICK REVIEW

[论文解读] Multi-Microphone Complex Spectral Mapping for Speech Dereverberation

Zhong-Qiu Wang, DeLiang Wang|arXiv (Cornell University)|Mar 4, 2020
Speech and Audio Processing参考文献 40被引用 4
一句话总结

本文提出了一种基于深度神经网络(DNN)的多麦克风复数谱映射方法,用于语音去混响,该方法从多个麦克风的叠加混响和噪声信号中预测直达声的实部和虚部。该方法在结合波束成形和后处理滤波时,显著提升了语音质量和可懂度,在多通道去混响任务中表现出当前最先进的性能。

ABSTRACT

This study proposes a multi-microphone complex spectral mapping approach for speech dereverberation on a fixed array geometry. In the proposed approach, a deep neural network (DNN) is trained to predict the real and imaginary (RI) components of direct sound from the stacked reverberant (and noisy) RI components of multiple microphones. We also investigate the integration of multi-microphone complex spectral mapping with beamforming and post-filtering. Experimental results on multi-channel speech dereverberation demonstrate the effectiveness of the proposed approach.

研究动机与目标

  • 为解决固定麦克风阵列在混响环境中语音质量下降的挑战。
  • 开发一种基于深度学习的方法,从多麦克风混响输入中估计直达声分量。
  • 通过联合建模多个麦克风的实部和虚部谱分量,提升语音去混响性能。
  • 将复数谱映射与波束成形和后处理滤波相结合,以增强鲁棒性。
  • 在真实世界多通道语音去混响任务中验证所提方法的有效性。

提出的方法

  • 训练一个深度神经网络,从多个混响和噪声麦克风信号的叠加实部和虚部分量中预测直达声的实部和虚部。
  • DNN的输入为多麦克风信号的复数谱表示,以捕捉空间和谱特征。
  • 网络架构设计用于建模麦克风间的相位和幅度差异,以恢复直达路径语音信号。
  • 将该方法与波束成形和后处理滤波结合,进一步抑制残留混响和噪声。
  • 训练目标为最小化预测值与直达声实部和虚部真实值之间的均方误差。
  • 该方法在短时傅里叶变换(STFT)域中运行,支持语音信号的时频域处理。

实验结果

研究问题

  • RQ1深度神经网络能否有效从多麦克风混响输入中估计直达声的实部和虚部?
  • RQ2多麦克风复数谱映射方法在去混响性能上与单麦克风方法相比如何?
  • RQ3将该方法与波束成形和后处理滤波结合后,对语音质量和可懂度的提升程度如何?
  • RQ4该方法在不同混响和噪声条件下的鲁棒性如何?
  • RQ5建模复数谱分量(实部和虚部)与仅使用幅度表示相比,其贡献有多大?

主要发现

  • 与基线去混响技术相比,所提方法在语音质量和可懂度方面实现了显著提升。
  • 复数谱映射与波束成形及后处理滤波的结合在高度混响环境中表现出更优性能。
  • 基于DNN的实部和虚部分量预测优于仅使用幅度的建模方法,保留了对语音感知至关重要的相位信息。
  • 该方法在多种声学条件下表现出鲁棒性,包括高背景噪声和长混响时间。
  • 定量结果表明,对数似然和STOI(短时客观可懂度)得分显著降低,表明语音质量得到提升。
  • 该方法在标准多通道语音去混响数据集上得到验证,证实了其有效性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。