Skip to main content
QUICK REVIEW

[论文解读] VSEGAN: Visual Speech Enhancement Generative Adversarial Network

Xinmeng Xu, Yan Wang|arXiv (Cornell University)|Feb 4, 2021
Speech and Audio Processing被引用 4
一句话总结

本文提出 VSEGAN,一种利用唇部运动视觉信息增强嘈杂语音的生成对抗网络。通过采用多层卷积编码器-解码器架构融合音频与视觉特征,并使用最小二乘 GAN 损失进行训练,VSEGAN 在 GRID 数据集上实现了语音质量与可懂度的最先进性能,PESQ 达 3.10,STOI 达 89.8%(SNR 为 0 dB),优于仅使用音频的模型与基线音频-视觉模型。

ABSTRACT

Speech enhancement is an essential task of improving speech quality in noise scenario. Several state-of-the-art approaches have introduced visual information for speech enhancement,since the visual aspect of speech is essentially unaffected by acoustic environment. This paper proposes a novel frameworkthat involves visual information for speech enhancement, by in-corporating a Generative Adversarial Network (GAN). In par-ticular, the proposed visual speech enhancement GAN consistof two networks trained in adversarial manner, i) a generator that adopts multi-layer feature fusion convolution network to enhance input noisy speech, and ii) a discriminator that attemptsto minimize the discrepancy between the distributions of the clean speech signal and enhanced speech signal. Experiment re-sults demonstrated superior performance of the proposed modelagainst several state-of-the-art

研究动机与目标

  • 通过利用唇部运动的视觉信息,提升嘈杂环境中的语音增强性能。
  • 解决仅使用音频的语音增强模型在低信噪比(SNR)条件下难以保持语音可懂度与质量的局限性。
  • 开发一种基于深度生成建模的鲁棒端到端音频-视觉语音增强框架。
  • 探究使用视觉线索进行对抗性训练是否能提升增强语音的感知质量与可懂度。
  • 证明多层特征融合与基于 GAN 的训练可提升视觉语音增强的鲁棒性与性能。

提出的方法

  • 该模型采用条件 GAN 框架,其中生成器以嘈杂音频与视觉视频帧作为输入,生成增强后的语音。
  • 生成器采用多层特征融合卷积网络,包含独立的音频(Conv-A)与视觉(Conv-V)编码器,随后进行音频-视觉融合(Conv-AV),并使用转置卷积进行解码。
  • 判别器被训练以区分真实干净语音与生成器生成的增强语音,采用最小二乘 GAN 损失以缓解梯度消失问题。
  • 训练目标结合感知损失(L1)与 GAN 损失,使用超参数 λ = 100 平衡两部分损失。
  • 音频特征表示为对数梅尔倒谱图(80 个频带,40ms 窗口,10ms 步长),视频帧处理为 5 帧片段,并通过空间与时间卷积处理。
  • 模型使用 ADAM 优化器训练 70 个周期,固定初始学习率为 1e-4,批量大小为 8。
Fig. 1 : Network architecture of generator. Conv-A, Conv-V, Conv-AV, BN, and Deconv denote convolution of audio encoder, convolution of video encoder, convolution of audio-visual fusion, batch normalization, and transposed convolution.
Fig. 1 : Network architecture of generator. Conv-A, Conv-V, Conv-AV, BN, and Deconv denote convolution of audio encoder, convolution of video encoder, convolution of audio-visual fusion, batch normalization, and transposed convolution.

实验结果

研究问题

  • RQ1唇部运动的视觉信息是否能显著提升嘈杂环境中语音增强的性能?
  • RQ2在音频-视觉语音增强中,采用基于 GAN 的框架与对抗性训练是否能带来更好的感知质量与可懂度?
  • RQ3音频与视觉流之间的多层特征融合如何影响增强模型的性能与训练稳定性?
  • RQ4在 PESQ 与 STOI 指标上,VSEGAN 与当前最先进音频-视觉语音增强模型相比表现如何?
  • RQ5所提模型在不同信噪比(SNR)条件下,特别是低 SNR 情况下,是否具备鲁棒性?

主要发现

  • 在 0 dB SNR 条件下,VSEGAN 达到 PESQ 3.10 与 STOI 89.8%,优于 SEGAN(PESQ: 2.21,STOI: 77.3%)与基线模型(PESQ: 2.94,STOI: 87.9%)。
  • 在 -5 dB SNR 条件下,VSEGAN 达到 PESQ 2.88 与 STOI 86.8%,表现出在强噪声条件下的优异性能。
  • 在 GRID 数据集上,VSEGAN 在 PESQ 与 STOI 两项指标上均超越近期最先进模型,包括 OVA(PESQ: 2.69,STOI: 89.75%)与 AV(SE)2(PESQ: 2.98,STOI: 89.44%)。
  • 视觉特征融合与 GAN 训练显著提升了增强质量,表现为 SEGAN(仅音频)与 VSEGAN(音频-视觉 GAN)之间的性能差距。
  • 频谱图可视化结果表明,与基线模型及仅生成器模型相比,VSEGAN 更好地保留了精细的频谱细节,并更有效地抑制了噪声。
  • 性能提升主要归因于视觉线索的整合与对抗性训练的结合,其感知质量的提升超越了仅依赖信号损失所能达到的效果。
Fig. 2 : Network architecture of discriminator, and GAN training procedure.
Fig. 2 : Network architecture of discriminator, and GAN training procedure.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。