[论文解读] VAW-GAN for Singing Voice Conversion with Non-parallel Training Data
该论文提出了一种基于VAW-GAN的非平行演唱语音转换框架,通过条件解码器将演唱者身份与基频轮廓从语音内容中解耦。通过同时对演唱者身份和基频进行条件控制,该模型在无需并行训练数据的情况下实现了高保真语音转换,在同性别与跨性别设置下均优于基线方法,在频谱相似度、语音质量与演唱者相似度方面表现更优。
Singing voice conversion aims to convert singer's voice from source to target without changing singing content. Parallel training data is typically required for the training of singing voice conversion system, that is however not practical in real-life applications. Recent encoder-decoder structures, such as variational autoencoding Wasserstein generative adversarial network (VAW-GAN), provide an effective way to learn a mapping through non-parallel training data. In this paper, we propose a singing voice conversion framework that is based on VAW-GAN. We train an encoder to disentangle singer identity and singing prosody (F0 contour) from phonetic content. By conditioning on singer identity and F0, the decoder generates output spectral features with unseen target singer identity, and improves the F0 rendering. Experimental results show that the proposed framework achieves better performance than the baseline frameworks.
研究动机与目标
- 开发一种无需并行训练数据的演唱语音转换系统,以避免高昂且不切实际的数据收集成本。
- 将演唱者身份与基频轮廓从语音内容中解耦,以实现更好的控制力与转换保真度。
- 在非并行设置下,通过基频条件控制提升演唱语音转换中的语音质量与演唱者相似度。
- 在训练流程中消除对时间对齐、自动语音识别(ASR)或外部模块的依赖。
- 证明在非并行演唱语音转换中,基频条件控制的有效性,这是该领域的一项新贡献。
提出的方法
- 该框架采用基于VAW-GAN的编码器-解码器架构,学习演唱者身份、基频轮廓与语音内容的解耦表征。
- 编码器将输入演唱语音映射为与演唱者身份和基频无关的潜在码,从而支持跨身份转换。
- 解码器在潜在码、目标演唱者身份与基频轮廓的条件下,重建频谱特征(MCEPs),以生成目标风格的语音。
- 通过显式注入基频条件到解码器中,提升基频再现与频谱准确性。
- 模型通过对抗损失、重建损失与基于变分自编码器(VAE)的KL散度项进行端到端训练。
- 由于VAE架构具备解耦特性,非并行训练得以实现,无需强制对齐或并行数据。
实验结果
研究问题
- RQ1非并行演唱语音转换系统是否能在无需并行训练数据的情况下实现高质量语音转换?
- RQ2在演唱语音转换中,对解码器施加基频条件是否能提升频谱准确度与语音质量?
- RQ3对演唱者身份与基频轮廓进行解耦表征学习,是否能带来更好的控制力与转换性能?
- RQ4所提出的基频条件机制与无此条件的基线模型相比,在客观与主观指标上表现如何?
- RQ5该框架在同性别与跨性别语音转换任务中的泛化能力如何?
主要发现
- 所提出的VAW-GAN(SID+F0)框架在男声到男声转换中达到5.51 dB的平均MCD,在男声到女声转换中为6.57 dB,优于基线VAW-GAN(SID)的6.20 dB与7.39 dB。
- 主观MOS评估显示,男声到男声转换的平均意见分(MOS)为3.03 ± 0.28,男声到女声转换为2.90 ± 0.31,表明语音质量显著提升。
- 在XAB偏好测试中,84.7%的听者偏好本模型在男声到男声转换中的表现,56.7%在男声到女声转换中,证明其演唱者相似度更优。
- 基频条件机制显著提升了基频再现与频谱保真度,表现为更低的MCD与更高的MOS评分。
- 该框架消除了对并行数据、时间对齐或ASR等外部模块的依赖,简化了训练流程。
- 结果证实,将演唱者身份与基频从潜在码中解耦,可实现有效的多对多演唱语音转换。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。