[论文解读] Relative Transfer Function Estimation Exploiting Spatially Separated Microphones in a Diffuse Noise Field
该论文提出了一种计算高效的相对传递函数(RTF)估计算法,通过在扩散噪声场中利用一个空间分离的外部麦克风,实现多麦克风语音增强。通过假设本地阵列与外部麦克风之间噪声分量的空间相干性可忽略不计,该方法仅基于本地麦克风协方差矩阵,推导出无偏的RTF估计器,在集成到在线MVDR波束成形器时,其估计精度和噪声抑制性能优于当前最先进的方法。
Many multi-microphone speech enhancement algorithms require the relative transfer function (RTF) vector of the desired speech source, relating the acoustic transfer functions of all array microphones to a reference microphone. In this paper, we propose a computationally efficient method to estimate the RTF vector in a diffuse noise field, which requires an additional microphone that is spatially separated from the microphone array, such that the spatial coherence between the noise components in the microphone array signals and the additional microphone signal is low. Assuming this spatial coherence to be zero, we show that an unbiased estimate of the RTF vector can be obtained. Based on real-world recordings experimental results show that the proposed RTF estimator outperforms state-of-the-art estimators using only the microphone array signals in terms of estimation accuracy and noise reduction performance.
研究动机与目标
- 解决混响和噪声环境中双耳及多麦克风语音增强系统中准确RTF估计的挑战。
- 通过避免如特征值分解(EVD)或奇异值分解(SVD)等迭代矩阵运算,降低RTF估计的计算复杂度。
- 利用与本地阵列噪声空间相干性较低的外部麦克风,提升估计精度和噪声抑制性能。
- 实现MVDR波束成形器的实时在线应用,具备鲁棒的RTF跟踪能力。
- 使用头戴式和桌面安装麦克风的实录数据对方法进行验证。
提出的方法
- 利用空间分离的外部麦克风,利用其噪声与本地麦克风阵列噪声分量之间低空间相干性的特性。
- 假设外部麦克风信号与本地阵列信号之间空间相干性为零,从而简化RTF估计器设计。
- 仅基于本地麦克风阵列的信号协方差矩阵,推导出无偏的RTF估计,避免了对噪声协方差估计的需求。
- 采用递归协方差估计结合指数平滑,实现实时适应源位置变化。
- 在双耳MVDR波束成形器中应用估计的RTF实现噪声抑制,使用时变噪声协方差估计。
- 采用赫米特角(Hermitian angle)和信噪比(SNR)提升作为RTF估计精度和波束成形器性能的评估指标。
实验结果
研究问题
- RQ1能否设计一种计算高效的RTF估计器,避免如EVD或SVD等迭代矩阵运算?
- RQ2利用与本地噪声空间相干性较低的外部麦克风,是否能相比仅使用阵列的方法提升RTF估计精度?
- RQ3所提方法在在线MVDR波束成形器设置中能否实现更优的噪声抑制性能?
- RQ4在真实世界非平稳条件下,该估计器在不同信噪比(SNR)和时间常数下的表现如何?
- RQ5该估计器对说话人位置变化和环境动态变化是否具备鲁棒性?
主要发现
- 在所有测试的信噪比(SNR)和时间常数下,所提出的基于空间相干性(SC)的RTF估计器在RTF估计精度上优于基于相关性(CS)和基于加权(CW)的估计器。
- 在输入SNR为0 dB、时间常数为50 ms时,所提估计器在语音活动开始后的前22帧内,赫米特角误差低于R1和PM-CS估计器。
- 由于仅依赖信号协方差,无需噪声段估计,该估计器对语音起始的响应速度更快。
- 在MVDR波束成形中,所提方法在所有输入SNR和时间常数下均实现了最高的SNR提升,表现出更优的噪声抑制性能。
- 即使在短时间常数(50 ms)下,该估计器仍保持高精度,支持对动态说话人运动的快速适应。
- 在假设外部麦克风与本地阵列噪声之间空间相干性为零的前提下,该方法实现了无偏的RTF估计,且通过真实世界数据验证了其有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。