Skip to main content
QUICK REVIEW

[论文解读] Noisy-to-Noisy Voice Conversion Framework with Denoising Model

Chao Xie, Yi-Chiao Wu|arXiv (Cornell University)|Sep 22, 2021
Speech Recognition and Synthesis参考文献 6被引用 7
一句话总结

本文提出了一种噪声到噪声(N2N)语音转换(VC)框架,通过将预训练的去噪模型(DCCRN)与基于VQ-VAE的VC模型结合,在说话人转换过程中保留背景声音。该方法将输入中的语音与噪声分离,在干净语音上执行VC,并将原始背景噪声重新添加到输出中,相较于直接的噪声到噪声训练,实现了更优的性能,同时提升了自然度和说话人相似度,且保持了上下文音频保真度。

ABSTRACT

In a conventional voice conversion (VC) framework, a VC model is often trained with a clean dataset consisting of speech data carefully recorded and selected by minimizing background interference. However, collecting such a high-quality dataset is expensive and time-consuming. Leveraging crowd-sourced speech data in training is more economical. Moreover, for some real-world VC scenarios such as VC in video and VC-based data augmentation for speech recognition systems, the background sounds themselves are also informative and need to be maintained. In this paper, to explore VC with the flexibility of handling background sounds, we propose a noisy-to-noisy (N2N) VC framework composed of a denoising module and a VC module. With the proposed framework, we can convert the speaker's identity while preserving the background sounds. Both objective and subjective evaluations are conducted, and the results reveal the effectiveness of the proposed framework.

研究动机与目标

  • 为解决传统语音转换(VC)依赖昂贵的清洁数据集的局限性,实现仅使用低质量、噪声语音数据进行训练。
  • 开发一种灵活的VC框架,在转换过程中保留背景声音,适用于视频处理和ASR数据增强等实际应用场景。
  • 探究预训练去噪模型在训练数据包含背景噪声时是否能提升VC性能。
  • 比较不同去噪模型(DCCRN与Conv-TasNet)对下游VC质量与鲁棒性的影响。
  • 在不同信噪比(SNR)条件下,通过客观指标与主观听音测试评估所提框架。

提出的方法

  • 采用两阶段框架:首先,使用预训练的DCCRN去噪模型将噪声输入分离为估计的语音与背景噪声分量。
  • 使用去噪后的语音训练基于VQ-VAE的语音转换模型,该模型学习在保留语言内容的同时转换说话人身份。
  • 在推理阶段,同一去噪模型处理源语音,独立提取干净语音与背景噪声信号。
  • 随后将转换后的语音与原始背景噪声重新组合,生成保留输入声学环境的最终输出。
  • 该框架支持灵活控制:可根据应用需求重新添加或抑制背景噪声。
  • 通过将DCCRN与Conv-TasNet均作为去噪组件进行评估,比较其对VC性能的影响。

实验结果

研究问题

  • RQ1仅在噪声语音数据上进行训练的语音转换系统能否实现高质量输出并保留背景声音?
  • RQ2与直接在噪声数据上进行训练相比,集成预训练去噪模型(如DCCRN)如何提升噪声到噪声语音转换的性能?
  • RQ3不同去噪架构(DCCRN与Conv-TasNet)对转换后语音的自然度与说话人相似度有何影响?
  • RQ4去噪模型引入的失真在VC流水线中在多大程度上会降低最终转换语音的质量?
  • RQ5所提框架能否在保留上下文背景声音的同时,实现接近干净到干净VC的性能?

主要发现

  • DCCRN-VC框架在平均意见得分(MOS)上达到3.08,说话人相似度(SIM)得分为51.6,显著优于基线Noisy-VC(MOS:2.07,SIM:39.4)。
  • DCCRN-VC在不同SNR水平(7 dB与15 dB)下性能保持稳定,表明其对噪声变化具有鲁棒性。
  • ConvTas-VC在MOS得分上与DCCRN-VC相当(均为3.08),表明Conv-TasNet残留的噪声在重新组合后对感知影响较小。
  • 尽管DCCRN的去噪性能更优,但其引入的失真轻微降低了音频质量,限制了其在MOS上相对于ConvTas-VC的提升。
  • 所提框架在噪声到噪声VC中实现了接近最先进水平的性能,显著优于直接的噪声到噪声训练,证明了预去噪在VC流水线中的价值。
  • 主观评估确认,重新组合后的背景声音被良好保留且感知自然,支持该框架在实际应用中的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。