Skip to main content
QUICK REVIEW

[论文解读] Interactive Feature Fusion for End-to-End Noise-Robust Speech Recognition

Yu‐Chen Hu, Nana Hou|arXiv (Cornell University)|Oct 11, 2021
Speech and Audio Processing被引用 5
一句话总结

本文提出了一种交互式特征融合网络(IFF-Net),通过联合融合增强语音和噪声语音特征,以提升嘈杂环境下的端到端自动语音识别(ASR)性能。通过在增强和噪声分支之间引入可学习权重掩码的双向交互机制,IFF-Net在RATS Channel-A语料库上相较最佳基线模型将词错误率(WER)降低了4.1%,有效缓解了语音增强中的过度抑制问题。

ABSTRACT

Speech enhancement (SE) aims to suppress the additive noise from a noisy speech signal to improve the speech's perceptual quality and intelligibility. However, the over-suppression phenomenon in the enhanced speech might degrade the performance of downstream automatic speech recognition (ASR) task due to the missing latent information. To alleviate such problem, we propose an interactive feature fusion network (IFF-Net) for noise-robust speech recognition to learn complementary information from the enhanced feature and original noisy feature. Experimental results show that the proposed method achieves absolute word error rate (WER) reduction of 4.1% over the best baseline on RATS Channel-A corpus. Our further analysis indicates that the proposed IFF-Net can complement some missing information in the over-suppressed enhanced feature.

研究动机与目标

  • 通过保留语音增强过程中丢失的潜在信息,解决语音增强中过度抑制问题对下游ASR性能的负面影响。
  • 通过多任务学习框架联合训练语音增强与ASR模块,提升噪声鲁棒性ASR性能。
  • 设计一种特征融合机制,学习来自增强特征与原始噪声特征的互补信息,以重建更鲁棒的ASR输入。
  • 证明交互式特征融合优于级联式、联合式和门控式融合方法,在噪声语音识别任务中表现更优。

提出的方法

  • IFF-Net采用两条并行分支——一条处理增强特征,一条处理噪声特征——并通过交互模块实现双向特征交换。
  • 每个分支使用上采样与下采样卷积块以保持空间与通道维度分辨率,随后采用可分离自注意力(SSA)的残差注意力(RA)模块进行全局上下文建模。
  • 交互模块通过允许每个分支关注并调制另一分支的特征,实现特征精炼,增强互补信息的学习。
  • 可学习的融合模块生成动态权重掩码,自适应地融合交互后的特征,优先保留来自增强语音的干净成分与来自噪声语音的鲁棒成分。
  • 整个系统采用端到端训练方式,使用结合ASR损失与语音增强重建损失的多任务目标函数。
  • 该架构设计旨在保留增强特征中过度抑制区域的语音内容,同时通过注意力引导的融合机制抑制噪声。

实验结果

研究问题

  • RQ1与标准联合训练相比,增强与噪声语音特征的交互式融合是否能有效降低端到端ASR在嘈杂条件下的词错误率(WER)?
  • RQ2保留原始噪声特征中的信息在多大程度上可缓解语音增强中因过度抑制导致的性能下降?
  • RQ3IFF-Net的各个组件(如交互模块、SSA模块和融合模块)对最终ASR性能的贡献如何?
  • RQ4双向交互(从噪声到增强与从增强到噪声)相比单向或无交互是否具有显著优势?
  • RQ5所提方法是否能在噪声鲁棒性ASR任务中超越现有基线模型,包括级联式、联合式与门控式融合方法?

主要发现

  • IFF-Net在RATS Channel-A语料库上相较最佳基线模型(GRF Network)实现了4.1%的绝对WER降低,证明其具有优越的噪声鲁棒性。
  • 仅移除噪声分支即导致WER绝对上升3.3%,证实原始噪声特征在恢复被抑制语音内容方面具有关键作用。
  • 交互模块贡献了1.8%的WER降低,且增强到噪声(e2n)与噪声到增强(n2e)双向交互路径对最优性能均不可或缺。
  • 可分离自注意力(SSA)模块显著提升性能,其移除导致WER上升3.1%,表明其在建模长距离依赖关系中的重要性。
  • 频谱图可视化结果表明,IFF-Net生成的融合特征噪声更低且语音内容更丰富,尤其在增强信号中被过度抑制的区域表现更优。
  • 融合模块中学习到的权重掩码能有效突出语音成分并抑制失真,实现互补特征的最优融合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。