[论文解读] Multi-channel Time-Varying Covariance Matrix Model for Late Reverberation Reduction
本文提出了一种用于晚期混响抑制的多通道时变协方差矩阵模型,将晚期混响的方差建模为语音源方差与声学传输函数(ATF)的时不变多通道协方差矩阵的卷积。该方法在时变声学条件下增强了鲁棒性,并在动态环境中实现了优越的去混响性能,其中扩展输入模型(PROPOSED 2)在FWSegSNR和PESQ等关键指标上优于所有基线方法。
In this paper, a multi-channel time-varying covariance matrix model for late reverberation reduction is proposed. Reflecting that variance of the late reverberation is time-varying and it depends on past speech source variance, the proposed model is defined as convolution of a speech source variance with a multi-channel time-invariant covariance matrix of late reverberation. The multi-channel time-invariant covariance matrix can be interpreted as a covariance matrix of a multi-channel acoustic transfer function (ATF). An advantageous point of the covariance matrix model against a deterministic ATF model is that the covariance matrix model is robust against fluctuation of the ATF. We propose two covariance matrix models. The first model is a covariance matrix model of late reverberation in the original microphone input signal. The second one is a covariance matrix model of late reverberation in an extended microphone input signal which includes not only current microphone input signal but also past microphone input signal. The second one considers correlation between the current microphone input signal and the past microphone input signal. Experimental results show that the proposed method effectively reduces reverberation especially in a time-varying ATF scenario and the second model is shown to be more effective than the first model.
研究动机与目标
- 解决多通道语音去混响中声学传输函数(ATF)估计的不稳定性,特别是在时变条件下的问题。
- 通过引入对ATF波动具有鲁棒性的概率协方差矩阵模型,克服确定性ATF模型的局限性。
- 将单通道非负卷积传输函数(N-CTF)模型扩展为多通道框架,以利用空间多样性。
- 提出两种协方差矩阵模型:一种用于当前麦克风信号,另一种用于包含过去输入信号的扩展信号,以捕捉时间相关性。
- 在传统方法如WPE和N-CTF性能下降的时变ATF场景中,提升去混响性能。
提出的方法
- 将晚期混响协方差矩阵建模为语音源方差(通过N-CTF)与表示声学传输函数(ATF)的时不变多通道协方差矩阵的卷积。
- 定义两种模型:(1) 当前麦克风输入中晚期混响的协方差矩阵;(2) 包含过去麦克风信号以捕捉与当前信号互相关性的扩展模型。
- 采用基于辅助函数的优化方法,类似于多通道非负矩阵分解(MNMF),以确保代价函数单调下降。
- 将多通道协方差矩阵视为ATF的空间表示,从而在时变条件下实现更鲁棒的估计。
- 使用变分贝叶斯类方法优化参数,避免联合估计ATF和语音源的需要。
- 将时变协方差模型集成到现有去混响框架中,未来工作可进一步扩展以包含均值向量建模。
实验结果
研究问题
- RQ1时变多通道协方差矩阵模型能否在ATF随时间变化的动态声学环境中有效抑制晚期混响?
- RQ2将过去麦克风信号纳入协方差模型后,与仅使用当前信号相比,能否提升去混响性能?
- RQ3所提出的协方差矩阵模型是否对ATF波动比确定性ATF模型或单通道N-CTF方法更具鲁棒性?
- RQ4包含时间相关性的扩展麦克风输入信号模型,在与原始模型对比时,能在多大程度上提升去混响性能?
- RQ5该方法在时不变和时变ATF场景下,能否在性能上超越WPE、N-CTF、KEMD和VB-MSD等最先进方法?
主要发现
- 所提方法在时变ATF场景中显著优于基线方法,FWSegSNR达到12.36 dB,PESQ得分为1.72,而TIV分别为10.74 dB和1.42。
- PROPOSED 2(包含过去信号的扩展模型)在所有指标上表现最佳,在时不变场景中FWSegSNR为12.92 dB,PESQ为1.91。
- 时变协方差矩阵模型(PROPOSED 1和2)始终优于仅使用时不变协方差矩阵的TIV,证明其在动态条件下的有效性。
- 在时变ATF情况下,PROPOSED 2相比次优方法VB-MSD,FWSegSNR提升1.62 dB,PESQ提升0.30。
- 扩展模型(PROPOSED 2)将倒谱距离(CD)降低至3.40 dB,为所有方法中最低,表明其在谱包络估计方面表现更优。
- 该方法对ATF波动表现出强鲁棒性,即使ATF随时间变化,性能仍保持一致提升,而WPE和N-CTF则显著退化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。