Skip to main content
QUICK REVIEW

[论文解读] Multi-Modal Hybrid Deep Neural Network for Speech Enhancement

Zhenhua Wu, Sunil Sivadas|arXiv (Cornell University)|Jun 15, 2016
Speech and Audio Processing参考文献 21被引用 13
一句话总结

本文提出了一种新颖的多模态混合深度神经网络——BiModal-BiLSTM,通过使用双向长短期记忆网络(BiLSTM)建模长期依赖关系,融合全连接DNN的音频特征与卷积神经网络(CNN)的视觉特征,实现对噪声语音的增强。该模型在非平稳噪声条件下表现出色,PESQ评分显著提升,证明了音频-视觉融合在语音增强中的有效性。

ABSTRACT

Deep Neural Networks (DNN) have been successful in en- hancing noisy speech signals. Enhancement is achieved by learning a nonlinear mapping function from the features of the corrupted speech signal to that of the reference clean speech signal. The quality of predicted features can be improved by providing additional side channel information that is robust to noise, such as visual cues. In this paper we propose a novel deep learning model inspired by insights from human audio visual perception. In the proposed unified hybrid architecture, features from a Convolution Neural Network (CNN) that processes the visual cues and features from a fully connected DNN that processes the audio signal are integrated using a Bidirectional Long Short-Term Memory (BiLSTM) network. The parameters of the hybrid model are jointly learned using backpropagation. We compare the quality of enhanced speech from the hybrid models with those from traditional DNN and BiLSTM models.

研究动机与目标

  • 通过利用唇部运动的视觉线索,提升在噪声环境下的语音增强性能。
  • 通过在统一的深度学习框架中整合音频与视觉模态,解决单模态模型的局限性。
  • 利用双向长短期记忆网络(BiLSTM)架构,建模音频-视觉特征中的长期时间依赖关系。
  • 通过反向传播联合优化混合模型的参数,实现端到端学习。
  • 在已见与未见噪声类型上验证模型性能,证明其鲁棒性与泛化能力。

提出的方法

  • 从一段噪声语音帧的窗口中,使用全连接DNN提取声学特征。
  • 使用卷积神经网络(CNN)处理视觉输入(唇部图像),提取高层空间表征。
  • 在每个时间步将音频与视觉特征拼接,形成联合表征以实现多模态融合。
  • 通过双向长短期记忆网络(BiLSTM)处理拼接后的特征,建模过去与未来的上下文信息。
  • 使用最终的全连接层,从BiLSTM输出重建增强后的谱特征。
  • 使用Adam优化与均方误差损失,通过反向传播对整个模型进行端到端训练。

实验结果

研究问题

  • RQ1视觉线索的引入是否能提升在噪声环境下的语音增强性能?
  • RQ2结合DNN、CNN与BiLSTM的混合架构,在语音增强中与单模态DNN和BiLSTM模型相比表现如何?
  • RQ3视觉特征在语音段与静音段中对噪声抑制的贡献程度如何?
  • RQ4BiModal-BiLSTM模型是否能很好地泛化到未见过的噪声类型(如交通噪声)?
  • RQ5多模态特征的联合优化在多大程度上影响模型重建干净语音谱的能力?

主要发现

  • BiModal-BiLSTM模型在验证集上实现了最低的均方误差(MSE),表明其特征重建精度更优。
  • 在所有信噪比(SNR)水平与噪声类型下,该模型的PESQ评分均优于单通道DNN与BiLSTM基线模型。
  • 在已见噪声条件(警报声与人群声)下,BiModal-BiLSTM的平均PESQ得分显著高于BiLSTM基线。
  • 即使在未见的交通噪声条件下,BiModal-BiLSTM仍保持强劲性能,尽管相较于BiLSTM基线的增益较小。
  • 谱图对比显示,该模型不仅抑制了噪声,还在语音活动段更完整地保留了语音细节,而不仅限于静音段。
  • 结果表明,视觉信息在非平稳噪声环境中(尤其在频谱重叠较高的情况下)对语音增强具有实质性贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。