Skip to main content
QUICK REVIEW

[论文解读] W-Net BF: DNN-based Beamformer Using Joint Training Approach

Yuichiro Koyama, Bhiksha Raj|arXiv (Cornell University)|Oct 31, 2019
Speech and Audio Processing参考文献 28被引用 4
一句话总结

本文提出 W-Net BF,一种基于深度神经网络(DNN)的波束成形器,通过联合训练噪声掩蔽参考估计器与波束成形滤波器估计器,结合了基于掩蔽方法的泛化能力与直接滤波器估计的滤波最优性。在静态与移动噪声源环境下评估,W-Net BF 在信噪比(SNR)、信号失真比(SDR)、短时客观 intelligibility(STOI)和客观意见评分(PESQ)等多项指标上均优于 U-Net BF 与 BLSTM-GEV,展现出对空间非平稳噪声更强的鲁棒性。

ABSTRACT

Acoustic beamformers have been widely used to enhance audio signals. The best current methods are DNN-powered variants of the generalized eigenvalue beamformer, and DNN-based filterestimation methods that directly compute beamforming filters. Both approaches, while effective, have blindspots in their generalizability. We propose a novel approach that combines both approaches into a single framework that attempts to exploit the best features of both. The resulting model, called a W-Net beamformer, includes two components: the first computes a noise-masked reference which the second uses to estimate beamforming filters. Results on data that include a wide variety of room and noise conditions, including static and mobile noise sources, show that the proposed beamformer outperforms other methods in all tested evaluation metrics.

研究动机与目标

  • 解决现有基于 DNN 的波束成形器仅依赖掩蔽估计或直接滤波器估计所带来的泛化能力局限。
  • 开发一种统一框架,利用基于掩蔽方法的鲁棒性与滤波估计方法的滤波效率。
  • 提升在非平稳声学环境下的性能,特别是针对移动噪声源的情况。
  • 验证联合训练在提升波束成形器泛化能力与鲁棒性方面的有效性。

提出的方法

  • W-Net BF 架构包含两个阶段:第一阶段为参考估计模块,利用 DNN 生成带噪声掩蔽的频谱图;第二阶段为波束成形滤波器估计模块,基于该参考计算最优滤波器。
  • 模型采用端到端的联合训练方式,同步优化两个模块,实现参考估计与滤波学习之间的更好对齐。
  • 参考估计模块采用类似 U-Net 的编码器-解码器结构,用于预测噪声与语音成分的时间-频率掩蔽。
  • 滤波器估计模块采用全卷积神经网络,用于在时频域预测复值波束成形滤波器。
  • 损失函数结合了信噪比(SNR)最大化与掩蔽预测目标,实现对两个组件的联合优化。
  • 该框架在包含多样化房间脉冲响应、语音源及静态/移动噪声源的仿真数据上进行训练,并针对移动噪声场景进行了微调。

实验结果

研究问题

  • RQ1联合训练框架是否能通过结合基于掩蔽与基于滤波估计的 DNN 波束成形器的优势,提升波束成形器性能?
  • RQ2所提出的 W-Net BF 架构在非平稳噪声环境中是否比独立的基于掩蔽或滤波估计模型具有更好的泛化能力?
  • RQ3参考估计与滤波学习的联合优化在应对移动噪声源时,是否能提升鲁棒性?
  • RQ4W-Net BF 在 SNR、SDR、STOI 与 PESQ 指标上,相较于现有最先进波束成形器,优势程度如何?

主要发现

  • 在 Static-Dataset 上,W-Net BF 实现平均 SNR 为 14.2 dB,优于 U-Net BF(13.5 dB)与 BLSTM-GEV(12.8 dB)。
  • 在 Moving-Dataset 上,W-Net BF 实现 13.0 dB 的 SNR,显著优于 BLSTM-GEV(11.5 dB),表明其对移动噪声源具有更强的处理能力。
  • 在 Static-Dataset 上,W-Net BF 实现平均 SDR 为 10.1 dB,优于 U-Net BF(9.3 dB)与 BLSTM-GEV(8.6 dB),表明增强信号的失真更低。
  • 联合训练组件(W-Net BF 与 W-Net BF† 对比)使 SNR 提升 0.7 dB,SDR 提升 0.8 dB,证实了端到端优化的有效性。
  • W-Net BF-m 在移动噪声数据上微调后,在 Moving-Dataset 上实现 12.5 dB 的 SNR,表明联合学习可有效适应动态噪声条件。
  • 在 Static-Dataset 上,模型实现 STOI 得分为 0.85,PESQ 得分为 2.7,表明语音可懂度与主观质量均较高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。