Skip to main content
QUICK REVIEW

[论文解读] RTF-steered binaural MVDR beamforming incorporating multiple external microphones

Nico Gößling, Wiebke Middelberg|arXiv (Cornell University)|Aug 13, 2019
Speech and Audio Processing参考文献 18被引用 5
一句话总结

该论文提出了一种新型的RTF驱动的双耳MVDR波束成形方法,通过三种融合策略(输入信噪比选择、平均、输出信噪比最大化)结合来自外部麦克风的多个RTF估计值。输出信噪比最大化组合的性能优于当前最先进方法,在混响扩散噪声环境中,针对移动说话人实现了10.7 dB的双耳信噪比增益。

ABSTRACT

The binaural minimum-variance distortionless-response (BMVDR) beamformer is a well-known noise reduction algorithm that can be steered using the relative transfer function (RTF) vector of the desired speech source. Exploiting the availability of an external microphone that is spatially separated from the head-mounted microphones, an efficient method has been recently proposed to estimate the RTF vector in a diffuse noise field. When multiple external microphones are available, different RTF vector estimates can be obtained by using this method for each external microphone. In this paper, we propose several procedures to combine these RTF vector estimates, either by selecting the estimate corresponding to the highest input SNR, by averaging the estimates or by combining the estimates in order to maximize the output SNR of the BMVDR beamformer. Experimental results for a moving speaker and diffuse noise in a reverberant environment show that the output SNR-maximizing combination yields the largest binaural SNR improvement and also outperforms the state-of-the art covariance whitening method.

研究动机与目标

  • 通过利用多个空间分离的外部麦克风,提升助听设备中的双耳噪声抑制性能。
  • 解决从不同外部麦克风获取的多个RTF向量估计值的融合挑战。
  • 开发并评估在动态、混响环境中提升波束成形性能的融合策略。
  • 在双耳信噪比增益方面超越现有方法(如协方差白化法)。

提出的方法

  • 在扩散噪声假设下,使用空间相干性(SC)方法估计每个外部麦克风的相对传递函数(RTF)向量。
  • 采用三种融合策略:选择输入信噪比最高的外部麦克风的RTF估计值、对所有估计值取平均、线性组合以最大化输出信噪比。
  • 采用窄带波束成形公式,其中MVDR波束成形权值基于组合后的RTF向量和噪声协方差矩阵计算得出。
  • 使用递归估计输入和噪声协方差矩阵,时间常数分别为250 ms和1.5 s。
  • 采用阴影滤波器方法进行时域双耳信噪比增益评估。
  • 通过在时间和频率上平均的双耳信噪比增益指标评估性能。

实验结果

研究问题

  • RQ1与单估计值方法相比,结合多个外部麦克风的RTF估计值是否能提升双耳MVDR波束成形性能?
  • RQ2在输入信噪比选择、平均和输出信噪比最大化这三种RTF向量融合策略中,哪一种能实现最佳的双耳信噪比增益?
  • RQ3所提出的输出信噪比最大化组合是否在动态、混响环境中优于当前最先进方法(如协方差白化法)?
  • RQ4对于移动说话人,所提出方法的性能如何随时间变化?

主要发现

  • 输出信噪比最大化组合(mSNR)实现了10.7 dB的最高双耳信噪比增益,显著优于当前最先进方法(协方差白化法)的10.4 dB。
  • 基于输入信噪比的选择方法(iSNR)实现了10.3 dB,与协方差白化法接近,但计算复杂度更低。
  • 平均方法(AV)仅实现了8.9 dB,表明简单平均会因外部麦克风间估计误差不一致而降低性能。
  • mSNR组合在所有时间点均优于iSNR和AV,如时域信噪比增益曲线所示。
  • mSNR方法相比iSNR方法实现了0.5 dB的增益,证明了信噪比优化在RTF融合中的有效性。
  • mSNR方法仅需3维特征值分解,尽管性能优越,但计算效率高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。