Skip to main content
QUICK REVIEW

[论文解读] IQDUBBING: Prosody modeling based on discrete self-supervised speech representation for expressive voice conversion

Wendong Gan, Bolong Wen|arXiv (Cornell University)|Jan 2, 2022
Speech Recognition and Synthesis被引用 7
一句话总结

该论文提出 IQDubbing,一种新颖的富有表现力的语音转换框架,利用 VQ-Wav2Vec 提取的离散自监督语音表征(DSSR)来建模语调,同时将其与说话人、内容和环境因素分离。通过应用两种语调滤波器——随机下采样滤波器和对齐下采样滤波器,该方法有效隔离了语调,实现了最先进的语音质量(MOS 3.867)、较高的语调一致性以及强大的说话人相似度。

ABSTRACT

Prosody modeling is important, but still challenging in expressive voice conversion. As prosody is difficult to model, and other factors, e.g., speaker, environment and content, which are entangled with prosody in speech, should be removed in prosody modeling. In this paper, we present IQDubbing to solve this problem for expressive voice conversion. To model prosody, we leverage the recent advances in discrete self-supervised speech representation (DSSR). Specifically, prosody vector is first extracted from pre-trained VQ-Wav2Vec model, where rich prosody information is embedded while most speaker and environment information are removed effectively by quantization. To further filter out the redundant information except prosody, such as content and partial speaker information, we propose two kinds of prosody filters to sample prosody from the prosody vector. Experiments show that IQDubbing is superior to baseline and comparison systems in terms of speech quality while maintaining prosody consistency and speaker similarity.

研究动机与目标

  • 解决在富有表现力语音转换中语调与说话人、内容和环境因素纠缠的问题。
  • 克服现有方法在非平行、富有表现力语音中无法有效分离语调与说话人及内容信息的局限性。
  • 通过利用离散自监督表征(DSSR)和专用的语调滤波机制,提升语音转换中的语音质量和语调一致性。
  • 在非平行设置下,实现从源说话人到目标说话人的富有表现力语调迁移的同时,保持高说话人相似度。
  • 证明两种新型语调滤波器——RDPF 和 ADPF——在优化语调向量以实现更好解耦与性能方面的有效性。

提出的方法

  • 使用预训练的 VQ-Wav2Vec 模型从源语音中提取离散自监督语音表征(DSSR),通过向量量化机制天然抑制说话人和环境信息。
  • 通过语调编码器从 DSSR 中提取语调向量,捕捉丰富的语调内容,同时最小化说话人和内容信息的泄露。
  • 应用两种语调滤波器——随机下采样语调滤波器(RDPF)和对齐下采样语调滤波器(ADPF)——通过仅采样相关语调特征,进一步优化语调向量。
  • 使用内容编码器从 ASR 瓶颈特征中提取语言内容,使用说话人编码器提取说话人身份,并使用基于 Transformer 的自回归解码器重建梅尔频谱图。
  • 使用 Adam 优化器和学习率衰减进行端到端训练,并采用 Parallel WaveGAN 进行波形合成。
  • 通过将内容、语调和说话人向量作为解码器的输入,实现整个系统的端到端优化。

实验结果

研究问题

  • RQ1VQ-Wav2Vec 提取的离散自监督语音表征(DSSR)能否在富有表现力语音转换中有效建模语调,同时抑制说话人和环境信息?
  • RQ2所提出的语调滤波器(RDPF 和 ADPF)在进一步从语调向量中解耦内容和残留说话人信息方面的有效性如何?
  • RQ3IQDubbing 框架在富有表现力语音转换中是否实现了优于基线和最先进方法的语音质量?
  • RQ4IQDubbing 在语音转换过程中在多大程度上保持了语调一致性和说话人相似度?
  • RQ5对齐下采样语调滤波器(ADPF)是否比随机下采样语调滤波器(RDPF)更有效地提升语音质量和语调保真度?

主要发现

  • IQDubbing-ADPF 达到最高的平均意见得分(MOS)3.867,显著优于基线(3.733)和对比系统(3.267),表明其具有更优的语音质量。
  • 语调一致性 AB 测试显示,IQDubbing-ADPF 在所有基线中表现最佳,包括 IQDubbing-Base 和 IQDubbing-RDPF,证实其在保持源语调方面的有效性。
  • IQDubbing-ADPF 的说话人相似度假接受率(FAR)为 0.830,接近基线(0.833),表明该方法在实现语调迁移的同时仍保持了强大的说话人相似度。
  • IQDubbing-Base 的 FAR 为 0.818,高于对比系统(0.617),表明基于 DSSR 的语调建模方法在说话人相似度方面优于先前方法。
  • 基于 RDPF 的变体(IQDubbing-RDPF)的 MOS 为 3.417,低于 IQDubbing-Base(3.750),表明随机下采样存在不稳定性,且 ADPF 的结构化采样更具优势。
  • ADPF 滤波器被发现比 RDPF 更有效地从语调向量中去除内容和说话人相关特征,从而带来更优的语音质量和语调一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。