Skip to main content
QUICK REVIEW

[论文解读] MFFCN: Multi-layer Feature Fusion Convolution Network for Audio-visual Speech Enhancement.

Xinmeng Xu, Dongxiang Xu|arXiv (Cornell University)|Jan 2, 2021
Speech and Audio Processing参考文献 38被引用 5
一句话总结

该论文提出MFFCN,一种多层特征融合卷积网络,通过逐层融合音频与视觉语音特征,提升噪声环境下的语音增强性能。通过学习超越简单拼接的模态对齐,其在信噪比-15 dB时实现最高24%的相对性能提升,PESQ得分从1.21提升至2.06。

ABSTRACT

The purpose of speech enhancement is to extract target speech signal from a mixture of sounds generated from several sources. Speech enhancement can potentially benefit from the visual information from the target speaker, such as lip move-ment and facial expressions, because the visual aspect of speech isessentially unaffected by acoustic environment. In order to fuse audio and visual information, an audio-visual fusion strategy is proposed, which goes beyond simple feature concatenation and learns to automatically align the two modalities, leading to more powerful representation which increase intelligibility in noisy conditions. The proposed model fuses audio-visual featureslayer by layer, and feed these audio-visual features to each corresponding decoding layer. Experiment results show relative improvement from 6% to 24% on test sets over the audio modalityalone, depending on audio noise level. Moreover, there is a significant increase of PESQ from 1.21 to 2.06 in our -15 dB SNR experiment.

研究动机与目标

  • 解决在音频信号仅依赖方法难以应对的噪声环境中语音质量下降的挑战。
  • 利用唇部运动和面部表情等视觉语音线索,提升对背景噪声的鲁棒性。
  • 开发一种深度学习框架,实现在网络多个层级上对音频与视觉特征进行对齐与融合。
  • 在低信噪比条件下,超越仅音频基线模型的语音增强性能。
  • 通过端到端的音视频特征融合,提升语音可懂度与感知质量。

提出的方法

  • 提出一种多层特征融合(MFF)策略,在编码器与解码器的每一层融合音频与视觉特征。
  • 采用共享的编码器-解码器架构,并为音频与视觉流分别设计模态特定的卷积模块。
  • 在每一层应用可学习的融合模块,以动态对齐并组合音频与视觉表征。
  • 将模态特定的特征整合到解码路径中,以重建增强后的语音信号。
  • 使用优化语音质量与可懂度的损失函数,进行端到端训练。
  • 采用残差连接与跳跃连接,以保留各层之间的细粒度时序特征。

实验结果

研究问题

  • RQ1与仅音频方法相比,音频与视觉特征的多层融合是否能提升语音增强性能?
  • RQ2通过融合模块学习模态对齐,在低信噪比条件下对语音质量有何影响?
  • RQ3在噪声环境中,视觉信息在多大程度上提升了可懂度与感知质量?
  • RQ4分层融合对PESQ及其他客观语音质量指标有何影响?
  • RQ5该模型在不同噪声水平下表现如何,特别是在-15 dB等具有挑战性的信噪比下?

主要发现

  • MFFCN模型在测试集上相比仅音频模型,相对性能提升在6%至24%之间,具体取决于噪声水平。
  • 在-15 dB信噪比下,PESQ得分从仅音频的1.21提升至2.06,表明感知质量显著提高。
  • 所提出的多层融合策略通过学习模态间的动态对齐,优于简单的特征拼接方法。
  • 该模型在多种噪声条件下均表现出稳健性能,语音可懂度持续提升。
  • 视觉特征的引入使语音重建更加稳定与准确,尤其在高噪声场景下优势明显。
  • 端到端训练框架成功学习到利用互补的音视频线索,以生成更优的语音输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。