[论文解读] A Recurrent Variational Autoencoder for Speech Enhancement
该论文提出了一种用于单通道语音增强的循环变分自编码器(RVAE),通过在潜在变量中利用时间依赖性,提升了前馈架构的重建性能。通过在测试时使用变分期望最大化(EM)算法微调编码器,模型捕捉了后验时间动态,实现了最先进的性能,相较于基线方法在SI-SDR上提升了6.8 dB。
This paper presents a generative approach to speech enhancement based on a recurrent variational autoencoder (RVAE). The deep generative speech model is trained using clean speech signals only, and it is combined with a nonnegative matrix factorization noise model for speech enhancement. We propose a variational expectation-maximization algorithm where the encoder of the RVAE is fine-tuned at test time, to approximate the distribution of the latent variables given the noisy speech observations. Compared with previous approaches based on feed-forward fully-connected architectures, the proposed recurrent deep generative speech model induces a posterior temporal dynamic over the latent variables, which is shown to improve the speech enhancement results.
研究动机与目标
- 为解决前馈VAE在建模语音信号时间依赖性方面的局限性。
- 通过在深度生成模型的潜在空间中引入循环动态,提升语音增强性能。
- 开发一种测试时推理方法,通过微调编码器以近似给定噪声观测下潜在变量的后验分布。
- 证明后验时间动态在超越独立帧建模之外提升语音质量方面的优势。
- 验证所提出的结合变分EM的RVAE相较于点估计替代方法和前馈基线的优越性。
提出的方法
- 使用基于RNN的解码器的循环VAE(RVAE),其条件依赖于整个潜在变量序列,从而实现对语音帧的时间建模。
- 采用非负矩阵分解(NMF)噪声模型,其参数在测试时从噪声混合信号中估计得到。
- 在测试时应用变分期望最大化(VEM)算法,其中编码器被微调以近似给定噪声输入下潜在变量的真实后验分布。
- 引入一种“点估计”替代方法(PEEM)用于对比,该方法仅使用潜在变量的最大后验估计。
- 对VEM目标使用R=1个样本的蒙特卡洛估计,并通过Adam优化,前馈神经网络(FFNN)使用10个梯度步长,RNN/双向RNN(BRNN)使用1个梯度步长,以平衡性能与计算开销。
- 模型仅在干净语音上进行训练,生成模型通过神经网络预测方差的复高斯似然定义。
实验结果
研究问题
- RQ1与前馈架构相比,将循环动态引入VAE的潜在空间是否能提升语音增强性能?
- RQ2通过变分EM在测试时微调编码器,是否能获得优于点估计推理的语音估计?
- RQ3由RNN架构引入的后验时间动态是否有助于稳定并改善VEM算法的优化?
- RQ4所提出的基于RVAE的方法在SI-SDR、PESQ和ESTOI方面与现有生成式和判别式方法相比如何?
- RQ5在该语音增强设置中,双向RNN(BRNN)变体是否显著优于单向RNN(RNN)?
主要发现
- 结合VEM的RVAE实现了6.8 dB的中位数SI-SDR,显著优于基于FFNN的VEM(4.4 dB)和PEEM(4.4 dB),证明了循环建模的优势。
- 基于RNN的模型实现了6.8 dB的SI-SDR,比使用MCEM的最优FFNN模型(5.4 dB)高出1.4 dB,表明时间动态的优势。
- BRNN模型实现了6.9 dB的SI-SDR,略优于RNN,但差异在统计上不显著,表明在此设置下双向上下文的收益有限。
- VEM算法在所有模型中均优于PEEM,RNN模型的SI-SDR提升了2.4 dB,证实了完整后验近似相较于点估计的价值。
- FFNN模型的VEM算法在迭代过程中性能下降,表明不稳定;而RNN模型保持稳定,表明时间动态有助于收敛与优化。
- 所提方法实现了0.67的ESTOI得分和2.35的PESQ,接近理想维纳滤波器(0.88 ESTOI,3.13 PESQ),表明尽管无配对训练数据,仍具有出色的感知质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。