[论文解读] VQVC+: One-Shot Voice Conversion by Vector Quantization and U-Net architecture
本文提出 VQVC+,一种结合 U-Net 架构与向量量化(VQ)的一次性语音转换方法,实现高质量且解耦的说话人与内容表征。通过利用 U-Net 的跳跃连接与 VQ 的强信息瓶颈,该模型在客观与主观评估中均优于 AutoVC 与 Chou 等人,在未见说话人场景下表现尤为突出,实现了音频自然度与说话人相似度的最先进性能。
Voice conversion (VC) is a task that transforms the source speaker's timbre, accent, and tones in audio into another one's while preserving the linguistic content. It is still a challenging work, especially in a one-shot setting. Auto-encoder-based VC methods disentangle the speaker and the content in input speech without given the speaker's identity, so these methods can further generalize to unseen speakers. The disentangle capability is achieved by vector quantization (VQ), adversarial training, or instance normalization (IN). However, the imperfect disentanglement may harm the quality of output speech. In this work, to further improve audio quality, we use the U-Net architecture within an auto-encoder-based VC system. We find that to leverage the U-Net architecture, a strong information bottleneck is necessary. The VQ-based method, which quantizes the latent vectors, can serve the purpose. The objective and the subjective evaluations show that the proposed method performs well in both audio naturalness and speaker similarity.
研究动机与目标
- 解决无需并行训练数据即可实现高保真一次性语音转换的挑战。
- 改进基于自编码器的语音转换系统中说话人与内容表征的解耦性。
- 通过整合 U-Net 与向量量化,提升音频自然度与说话人相似度,尤其针对未见说话人。
- 证明 VQ 提供强信息瓶颈,使 U-Net 能够在不发生过拟合于重建任务的情况下实现良好泛化。
- 表明通过自重建学习得到的说话人嵌入在无显式说话人监督下,对零样本语音转换有效。
提出的方法
- 模型采用基于 U-Net 的自编码器,通过编码器与解码器层之间的跳跃连接,保留频谱图的细粒度细节。
- 对潜在表征应用向量量化(VQ),生成离散代码本,强制施加强信息瓶颈,以促进表征解耦。
- 说话人嵌入通过连续潜在向量与其量化对应物之间差异的全局平均计算得出:$\vec{s} = \mathbb{E}_t[\vec{V} - \vec{C}]$,随后在时间维度上重复以匹配维度。
- 内容与说话人嵌入组合为 $\vec{C} + \vec{S}$,并输入解码器以重建输入音频。
- 模型仅通过自重建损失进行训练:$L_{rec} = \mathbb{E}[||\hat{\vec{X}} - \vec{X}||_1]$,不使用对抗性损失或显式说话人损失。
- 在量化前应用实例归一化,以稳定训练并提升解耦性能。

实验结果
研究问题
- RQ1U-Net 架构是否可在不损害解耦性的前提下,有效应用于一次性语音转换?
- RQ2向量量化是否足以作为信息瓶颈,防止 U-Net 在重建任务上发生过拟合?
- RQ3仅通过自重建损失与 VQ,能否有效实现说话人嵌入与内容表征的解耦?
- RQ4所提方法在音频质量与说话人相似度方面表现如何,尤其针对未见说话人?
- RQ5U-Net 与 VQ 的结合是否在主观与客观评估中优于现有基于自编码器的方法(如 AutoVC 与 Chou 等人)?
主要发现
- 对于未见说话人("-U"),VQVC+ 的平均意见评分(MOS)达到 4.48,优于 AutoVC(4.21)与 Chou 等人(4.32),在音频自然度方面表现更优。
- 在说话人相似度方面,VQVC+ 对未见说话人的 MOS 达到 4.51,超过 AutoVC(4.24)与 Chou 等人(4.35)。
- 在成对比较中,VQVC+ 在 72.5% 的情况下被偏好用于自然度,74.1% 的情况下被偏好用于说话人相似度,相较于基线模型在未见说话人上的表现。
- 从 $\vec{S}_0$ 提取的嵌入在说话人分类器上的准确率达到 98.3%,表明学习到的嵌入具有强说话人相关性。
- 采用 VQ 与 U-Net 的模型(Q64)在从 $\vec{S}_0$ 进行说话人识别时达到 98.3% 的准确率,而仅使用实例归一化(无量化)的变体仅达 97.4%,表明 VQ 显著增强了表征解耦。
- 主观评估证实,VQVC+ 在未见说话人上的泛化能力优于基线模型,展现出在一次性语音转换中的稳健性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。