Skip to main content
QUICK REVIEW

[论文解读] DOA Estimation by DNN-based Denoising and Dereverberation from Sound Intensity Vector

Masahiro Yasuda, Yuma Koizumi|arXiv (Cornell University)|Oct 10, 2019
Speech and Audio Processing参考文献 7被引用 4
一句话总结

本文提出了一种混合DOA估计算法,通过使用两个深度神经网络(DNN)进行去噪和混响抑制,提升了基于声音强度矢量(IV)的波达方向(DOA)估计算法。DNN在时频域对IV进行优化后,再应用基于物理模型的DOA估计算法,平均DOA误差达到0.528°,显著优于传统的IV-based方法和端到端DNN方法。

ABSTRACT

We propose a direction of arrival (DOA) estimation method that combines sound-intensity vector (IV)-based DOA estimation and DNN-based denoising and dereverberation. Since the accuracy of IV-based DOA estimation degrades due to environmental noise and reverberation, two DNNs are used to remove such effects from the observed IVs. DOA is then estimated from the refined IVs based on the physics of wave propagation. Experiments on an open dataset showed that the average DOA error of the proposed method was 0.528 degrees, and it outperformed a conventional IV-based and DNN-based DOA estimation method.

研究动机与目标

  • 提升在低信噪比(low-SNR)和混响环境下的IV-based DOA估计算法的鲁棒性。
  • 解决纯参数化IV-based方法在噪声和混响下性能下降的局限性。
  • 将基于DNN的信号增强与物理波传播模型相结合,在保持可解释性的同时提升精度。
  • 证明将基于DNN的预处理与基于物理模型的DOA估计算法结合,性能优于端到端DNN或独立的IV方法。
  • 验证空间增强与多任务学习在提升DOA估计算法鲁棒性方面的有效性。

提出的方法

  • 利用一阶体感(FOA)B格式信号,从四通道频谱图中计算时频域声音强度矢量(IVs)。
  • 应用时频掩码(MASKnet)通过能量阈值选择高能量时频单元以抑制噪声。
  • 采用第二个DNN(RIVnet)通过估计并减去IV中的残留干扰来降低混响影响。
  • 将去噪与去混响后的IV组合,利用基于物理模型的公式计算时序DOA:$\phi_t = \arctan(I_{Y,t}/I_{X,t})$,$\theta_t = \arctan(I_{Z,t}/\sqrt{I_{X,t}^2 + I_{Y,t}^2})$。
  • 使用多任务损失函数,联合优化角度估计与声源存在性检测(SAD)损失,以同时优化DOA回归与声源检测。
  • 在FOA域应用16种模式的空间增强策略,以提升训练过程中的泛化能力与鲁棒性。

实验结果

研究问题

  • RQ1基于DNN的去噪与去混响处理是否能提升在噪声与混响环境中IV-based DOA估计算法的准确性?
  • RQ2将基于DNN的信号增强与基于物理模型的DOA估计算法结合,是否能获得优于端到端DNN或传统IV方法的性能?
  • RQ3时频掩码(MASKnet)与残差IV估计网络(RIVnet)在优化IV用于DOA估计算法方面有多高效?
  • RQ4在FOA域中应用空间增强策略在多大程度上提升了所提方法的鲁棒性?
  • RQ5将SAD与DOA估计算法结合,是否能提升时序DOA任务的整体系统性能?

主要发现

  • 所提方法实现了0.528°的平均DOA误差,显著优于传统IV-based方法与端到端DNN基线方法。
  • 采用MASKnet与RIVnet的架构B(含去混响)的DOA误差低于仅使用MASKnet的架构A(无RIVnet),证明了去混响处理在提升IV-based DOA估计算法性能方面的有效性。
  • 采用FOA域空间增强的架构C实现了最低的平均DOA误差,证实了数据增强可有效提升DNN在DOA估计中的泛化能力。
  • 所提方法的帧召回率(FR)性能优于传统IV-based方法,表明声源存在性检测的准确性得到提升。
  • 采用联合DOA与SAD损失的多任务学习设置,提升了时序DOA估计算法的整体鲁棒性与精度。
  • 通过中值平滑处理离散化DOA估计结果(10°分辨率)进一步提升了输出的一致性,并减少了事件级DOA输出的角抖动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。