[论文解读] Robust One-Shot Singing Voice Conversion
该论文提出了一种新型框架——鲁棒一次式歌唱语音转换(ROSVC),仅需不到10秒的参考音频,即可实现对任意未见歌手的高保真、音高准确的语音转换,即使输入受混响和伴奏音乐干扰也能保持性能。该方法结合了基于生成对抗网络(GAN)的一次式SVC模型、音高分布匹配以及AdaIN跳连条件机制,采用两阶段训练策略(Robustify)以增强对失真的鲁棒性,并引入基于分层扩散的神经声码器以提升语音质量和音高稳定性,在主观与客观评估中均优于当前最先进方法。
Recent progress in deep generative models has improved the quality of voice conversion in the speech domain. However, high-quality singing voice conversion (SVC) of unseen singers remains challenging due to the wider variety of musical expressions in pitch, loudness, and pronunciation. Moreover, singing voices are often recorded with reverb and accompaniment music, which make SVC even more challenging. In this work, we present a robust one-shot SVC (ROSVC) that performs any-to-any SVC robustly even on such distorted singing voices. To this end, we first propose a one-shot SVC model based on generative adversarial networks that generalizes to unseen singers via partial domain conditioning and learns to accurately recover the target pitch via pitch distribution matching and AdaIN-skip conditioning. We then propose a two-stage training method called Robustify that train the one-shot SVC model in the first stage on clean data to ensure high-quality conversion, and introduces enhancement modules to the encoders of the model in the second stage to enhance the feature extraction from distorted singing voices. To further improve the voice quality and pitch reconstruction accuracy, we finally propose a hierarchical diffusion model for singing voice neural vocoders. Experimental results show that the proposed method outperforms state-of-the-art one-shot SVC baselines for both seen and unseen singers and significantly improves the robustness against distortions.
研究动机与目标
- 解决在真实失真环境(如混响和背景音乐)下对未见歌手进行高质量歌唱语音转换(SVC)的挑战。
- 在不依赖去混响或声源分离等预处理技术的前提下,提升一次式SVC模型对声学失真的鲁棒性。
- 在目标歌手未出现在训练数据中的情况下,实现准确的音高恢复与自然的语音质量。
- 开发一种神经声码器,以提升转换后歌唱语音的感知质量与音高稳定性。
提出的方法
- 提出一种基于生成对抗网络(GAN)的一次式SVC模型,结合部分域条件与音高分布匹配,以实现对未见歌手的泛化能力。
- 引入AdaIN跳连条件机制,通过在转换过程中保留与音高相关的特征,提升音高重建的准确性。
- 设计一种两阶段训练框架Robustify:首先在干净数据上进行预训练以实现高质量转换,然后在编码器中引入增强模块进行微调,以提升对混响与音乐干扰的鲁棒性。
- 设计一种基于分层扩散模型的神经声码器(HPG),通过在不同采样率下使用多个扩散模型,生成高保真度的歌唱语音并提升音高稳定性。
- 采用多尺度条件策略,直接将低采样率波形用作条件,以引导低频分量的生成。
- 在NUS48E、NHSS和MUSDB18数据集上验证方法,与五种当前最先进的一次式VC基线方法进行比较。
实验结果
研究问题
- RQ1一次式SVC模型能否在保持准确音高与自然度的同时,实现对未见歌手的高质量语音转换?
- RQ2如何使一次式SVC模型在不依赖预处理技术(如去混响或声源分离)的前提下,对现实世界中的失真(如混响与背景音乐)具有鲁棒性?
- RQ3与自回归或GAN-based声码器相比,基于分层扩散的声码器是否能提升转换后歌唱语音的感知质量与音高准确性?
- RQ4两阶段训练策略(Robustify)在多大程度上增强了从失真输入中提取特征的鲁棒性?
- RQ5直接对低采样率波形进行条件输入,能否提升生成歌唱语音的保真度与稳定性?
主要发现
- 所提出的ROSVC模型取得MOS评分为4.07,显著优于PriorGrad(3.70)与PWG(2.81),证明其感知质量更优。
- 在偏好测试中,85.3%的评分者更偏好HPG-2模型,证实其自然度与音频质量更优。
- 分层扩散声码器(HPG-2)的PMAE为1.82,低于PriorGrad(1.80)与PWG(3.12),表明其音高准确性更优。
- HPG-3(三阶段分层模型)进一步将PMAE降低至1.67,MCD降至8.12,仅增加30%计算成本,性能显著提升。
- 消融实验证实,对低速率波形($x_0^2$)进行条件输入对生成低频分量至关重要,而仅使用梅尔频谱不足以实现全频带保真度。
- Robustify训练策略显著提升了对混响与音乐干扰的鲁棒性,使模型在失真输入下仍能稳定运行,而基线模型则失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。