Skip to main content
QUICK REVIEW

[论文解读] DBNET: DOA-driven beamforming network for end-to-end farfield sound source separation

Ali Aroudi, Sebastian Braun|arXiv (Cornell University)|Oct 22, 2020
Speech and Audio Processing参考文献 24被引用 6
一句话总结

本文提出DBNet,一种用于远场声源分离的端到端深度学习框架,通过整合DOA估计与波束成形,无需使用真实DOA标注。仅通过语音信号重建损失进行训练,DBNet能够学习估计声源方向并抑制噪声,当与卷积-循环后掩蔽网络结合时,性能显著提升,在高度混响和噪声环境中实现了最先进的SIR和PESQ提升。

ABSTRACT

Many deep learning techniques are available to perform source separation and reduce background noise. However, designing an end-to-end multi-channel source separation method using deep learning and conventional acoustic signal processing techniques still remains challenging. In this paper we propose a direction-of-arrival-driven beamforming network (DBnet) consisting of direction-of-arrival (DOA) estimation and beamforming layers for end-to-end source separation. We propose to train DBnet using loss functions that are solely based on the distances between the separated speech signals and the target speech signals, without a need for the ground-truth DOAs of speakers. To improve the source separation performance, we also propose end-to-end extensions of DBnet which incorporate post masking networks. We evaluate the proposed DBnet and its extensions on a very challenging dataset, targeting realistic far-field sound source separation in reverberant and noisy environments. The experimental results show that the proposed extended DBnet using a convolutional-recurrent post masking network outperforms state-of-the-art source separation methods.

研究动机与目标

  • 开发一种端到端的多通道声源分离系统,通过深度学习整合DOA估计与波束成形。
  • 通过仅依赖语音信号重建损失,消除训练过程中对真实DOA标注的需求。
  • 通过波束成形与后掩蔽组件的端到端优化,提升在高度混响和噪声环境中的分离性能。
  • 在大规模、真实的远场数据集上评估该框架,模拟源距离达10米的条件。

提出的方法

  • DBNet采用STFT、DOA估计、波束成形和iSTFT层的堆叠结构,以频域方式处理多通道麦克风信号。
  • 网络使用基于信号的损失函数进行训练——具体为复数谱距离(cMSE),无需真实DOA标签。
  • 引入后掩蔽网络(pMnet)作为端到端扩展,采用卷积-循环编码器-解码器架构,以优化波束成形输出。
  • pMnet使用幅度、复数谱或组合距离损失进行训练,以增强残余噪声抑制。
  • 合成大规模增强训练数据集,以提升在未见声学条件下的泛化能力。
  • 整个系统实现端到端优化,支持从时域输出信号到输入麦克风信号的梯度反传。

实验结果

研究问题

  • RQ1能否在无需真实DOA监督的情况下,实现DOA驱动波束成形的端到端训练?
  • RQ2后掩蔽网络的集成如何影响在混响和噪声环境中声源分离的性能?
  • RQ3何种损失函数配置能在语音质量和分离精度之间取得最佳平衡?
  • RQ4网络架构选择(循环与卷积-循环)在挑战性声学条件下的性能影响如何?

主要发现

  • 采用卷积-循环后掩蔽网络的DBnet(DBnet(CR)-Mnet(CR))实现了6.86 dB的最高SIR提升,显著优于当前最先进方法。
  • Mnet(CR)基线的SDR提升达26.15 dB,在最佳DBnet扩展中得以保持或超越,PESQ提升达0.21。
  • 无需真实DOA标签的训练有效:DBnet(CR)实现了1.26 dB的SIR提升,证明仅通过信号重建即可实现端到端的DOA估计。
  • cMSE损失函数表现最佳,复数谱距离(α=1)在所有指标上均优于仅幅度损失(α=0)。
  • DOA估计与后掩蔽中的卷积-循环结构至关重要——仅循环结构的变体在SIR和PESQ上表现下降。
  • DBnet(CR)-Mnet(CR)配置实现了24.11 dB的SDR提升和6.86 dB的SIR提升,表明在真实世界条件下具备强大的噪声与混响抑制能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。