Skip to main content
QUICK REVIEW

[论文解读] A Recurrent Variational Autoencoder for Speech Enhancement

Simon Leglaive, Xavier Alameda-Pineda|arXiv (Cornell University)|Oct 24, 2019
Speech and Audio Processing参考文献 33被引用 5
一句话总结

该论文提出了一种用于单通道语音增强的循环变分自编码器(RVAE),通过在潜在变量中利用时间依赖性,提升了前馈架构的重建性能。通过在测试时使用变分期望最大化(EM)算法微调编码器,模型捕捉了后验时间动态,实现了最先进的性能,相较于基线方法在SI-SDR上提升了6.8 dB。

ABSTRACT

This paper presents a generative approach to speech enhancement based on a recurrent variational autoencoder (RVAE). The deep generative speech model is trained using clean speech signals only, and it is combined with a nonnegative matrix factorization noise model for speech enhancement. We propose a variational expectation-maximization algorithm where the encoder of the RVAE is fine-tuned at test time, to approximate the distribution of the latent variables given the noisy speech observations. Compared with previous approaches based on feed-forward fully-connected architectures, the proposed recurrent deep generative speech model induces a posterior temporal dynamic over the latent variables, which is shown to improve the speech enhancement results.

研究动机与目标

  • 为解决前馈VAE在建模语音信号时间依赖性方面的局限性。
  • 通过在深度生成模型的潜在空间中引入循环动态,提升语音增强性能。
  • 开发一种测试时推理方法,通过微调编码器以近似给定噪声观测下潜在变量的后验分布。
  • 证明后验时间动态在超越独立帧建模之外提升语音质量方面的优势。
  • 验证所提出的结合变分EM的RVAE相较于点估计替代方法和前馈基线的优越性。

提出的方法

  • 使用基于RNN的解码器的循环VAE(RVAE),其条件依赖于整个潜在变量序列,从而实现对语音帧的时间建模。
  • 采用非负矩阵分解(NMF)噪声模型,其参数在测试时从噪声混合信号中估计得到。
  • 在测试时应用变分期望最大化(VEM)算法,其中编码器被微调以近似给定噪声输入下潜在变量的真实后验分布。
  • 引入一种“点估计”替代方法(PEEM)用于对比,该方法仅使用潜在变量的最大后验估计。
  • 对VEM目标使用R=1个样本的蒙特卡洛估计,并通过Adam优化,前馈神经网络(FFNN)使用10个梯度步长,RNN/双向RNN(BRNN)使用1个梯度步长,以平衡性能与计算开销。
  • 模型仅在干净语音上进行训练,生成模型通过神经网络预测方差的复高斯似然定义。

实验结果

研究问题

  • RQ1与前馈架构相比,将循环动态引入VAE的潜在空间是否能提升语音增强性能?
  • RQ2通过变分EM在测试时微调编码器,是否能获得优于点估计推理的语音估计?
  • RQ3由RNN架构引入的后验时间动态是否有助于稳定并改善VEM算法的优化?
  • RQ4所提出的基于RVAE的方法在SI-SDR、PESQ和ESTOI方面与现有生成式和判别式方法相比如何?
  • RQ5在该语音增强设置中,双向RNN(BRNN)变体是否显著优于单向RNN(RNN)?

主要发现

  • 结合VEM的RVAE实现了6.8 dB的中位数SI-SDR,显著优于基于FFNN的VEM(4.4 dB)和PEEM(4.4 dB),证明了循环建模的优势。
  • 基于RNN的模型实现了6.8 dB的SI-SDR,比使用MCEM的最优FFNN模型(5.4 dB)高出1.4 dB,表明时间动态的优势。
  • BRNN模型实现了6.9 dB的SI-SDR,略优于RNN,但差异在统计上不显著,表明在此设置下双向上下文的收益有限。
  • VEM算法在所有模型中均优于PEEM,RNN模型的SI-SDR提升了2.4 dB,证实了完整后验近似相较于点估计的价值。
  • FFNN模型的VEM算法在迭代过程中性能下降,表明不稳定;而RNN模型保持稳定,表明时间动态有助于收敛与优化。
  • 所提方法实现了0.67的ESTOI得分和2.35的PESQ,接近理想维纳滤波器(0.88 ESTOI,3.13 PESQ),表明尽管无配对训练数据,仍具有出色的感知质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。