Skip to main content
QUICK REVIEW

[论文解读] NoiseVC: Towards High Quality Zero-Shot Voice Conversion

Shijun Wang, Damian Borth|arXiv (Cornell University)|Apr 13, 2021
Speech Recognition and Synthesis参考文献 30被引用 6
一句话总结

NoiseVC 提出了一种零样本语音转换模型,通过向量量化(VQ)和对比预测编码(CPC)将语言内容与说话人特征解耦,并结合噪声增强技术。该模型在无需平行数据、预训练模型或文本转录的情况下,实现了高质量的语音转换,即使在使用大码书时也能保持强大的解耦能力与音频质量。

ABSTRACT

Voice conversion (VC) is a task that transforms voice from target audio to source without losing linguistic contents, it is challenging especially when source and target speakers are unseen during training (zero-shot VC). Previous approaches require a pre-trained model or linguistic data to do the zero-shot conversion. Meanwhile, VC models with Vector Quantization (VQ) or Instance Normalization (IN) are able to disentangle contents from audios and achieve successful conversions. However, disentanglement in these models highly relies on heavily constrained bottleneck layers, thus, the sound quality is drastically sacrificed. In this paper, we propose NoiseVC, an approach that can disentangle contents based on VQ and Contrastive Predictive Coding (CPC). Additionally, Noise Augmentation is performed to further enhance disentanglement capability. We conduct several experiments and demonstrate that NoiseVC has a strong disentanglement ability with a small sacrifice of quality.

研究动机与目标

  • 解决训练期间源说话人和目标说话人均未见过的零样本语音转换挑战。
  • 在不依赖平行数据或文本转录的情况下,提升语言内容与说话人特征的解耦能力。
  • 在低资源语言设置下,保持高音频质量的同时实现稳健的解耦。
  • 探索对比预测编码(CPC)和噪声增强在提升内容表征学习效果方面的有效性。

提出的方法

  • 使用向量量化(VQ)将连续编码器特征映射为离散潜在码,实现内容表征学习。
  • 采用对比预测编码(CPC)模块,通过上下文预测未来量化码,提升内容表征的鲁棒性。
  • 在训练中应用噪声增强,通过交替输入带噪和干净的频谱图给说话人编码器,增强解耦能力。
  • 使用说话人编码器从输入中提取说话人嵌入,并将其与内容嵌入拼接后用于解码。
  • 采用多尺度残差 U-Net 解码器,从拼接的内容与说话人嵌入中重建高保真波形。
  • 通过重建损失、VQ 一致性损失以及 CPC 的对比预测损失进行联合优化,实现端到端训练。

实验结果

研究问题

  • RQ1基于 VQ 的语音转换模型是否能在不依赖平行数据或文本转录的情况下,实现内容与说话人因子的强解耦?
  • RQ2对比预测编码(CPC)在提升零样本语音转换中的内容表征学习方面效果如何?
  • RQ3在无瓶颈约束条件下,噪声增强是否能提升解耦能力?
  • RQ4当使用大码书尺寸以避免质量下降时,模型在多大程度上能保持音频质量?
  • RQ5与有监督或基线零样本方法相比,该模型在未见说话人上的零样本设置下的表现如何?

主要发现

  • 在无噪声增强的情况下,NoiseVC 在内容嵌入上的说话人分类准确率为 59%,当加入 CPC 后下降至 30%,表明解耦能力得到改善。
  • 在噪声增强(α = 0.5)条件下,说话人分类准确率进一步降至 22%,证明了解耦能力增强的同时保持了重建质量。
  • 在未见说话人上的零样本转换中,语音相似度的平均意见评分(MOS)达到 4.2,优于基线模型。
  • NoiseVC 的音频质量 MOS 得分较高(约 4.0),表明感知质量良好,尤其考虑到其未使用平行数据或文本监督。
  • t-SNE 可视化显示,20 个未见说话人在说话人嵌入空间中呈现清晰聚类,说话人分类准确率达 98.9%。
  • 即使使用大码书,模型仍保持强大的重建能力(低重建损失),避免了因瓶颈约束受限而产生的性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。