[论文解读] FreeVC: Towards High-Quality Text-Free One-Shot Voice Conversion
FreeVC 提出了一种无需文本、单次输入的语音转换系统,利用 VITS 实现高质量波形重建,并通过自监督的 WavLM 特征瓶颈将内容与说话人信息解耦,无需文本标注。通过引入频谱图缩放数据增强,提升了内容纯净度,在自然度和语言一致性方面优于基于文本的模型,同时在低质量输入下仍保持鲁棒性。
Voice conversion (VC) can be achieved by first extracting source content information and target speaker information, and then reconstructing waveform with these information. However, current approaches normally either extract dirty content information with speaker information leaked in, or demand a large amount of annotated data for training. Besides, the quality of reconstructed waveform can be degraded by the mismatch between conversion model and vocoder. In this paper, we adopt the end-to-end framework of VITS for high-quality waveform reconstruction, and propose strategies for clean content information extraction without text annotation. We disentangle content information by imposing an information bottleneck to WavLM features, and propose the spectrogram-resize based data augmentation to improve the purity of extracted content information. Experimental results show that the proposed method outperforms the latest VC models trained with annotated data and has greater robustness.
研究动机与目标
- 开发一种无需文本标注或大规模有标签数据的无文本、单次语音转换系统。
- 改进自监督表征中内容与说话人信息的解耦,减少内容特征中的说话人泄漏。
- 通过单阶段 VITS 框架将转换模型与声码器对齐,提升波形重建质量。
- 通过数据增强和模型设计提升对低质量源语音和未见目标说话人的鲁棒性。
- 在无需文本监督的前提下,在主观和客观指标上达到或超过基于文本模型的性能。
提出的方法
- 采用 VITS 框架作为单阶段端到端模型,联合建模内容与说话人信息,实现高质量波形生成。
- 使用 WavLM 从原始波形中提取自监督语音表征,随后通过瓶颈提取器分离出内容信息。
- 通过对 WavLM 特征施加信息瓶颈,将其压缩到低维空间,迫使模型丢弃说话人特异性细节。
- 引入频谱图缩放(SR)数据增强,扭曲说话人特征的同时保留内容信息,提升训练过程中的解耦效果。
- 使用说话人编码器(预训练或非预训练)从单个参考语音中提取目标说话人嵌入,实现单次语音转换。
- 通过对抗损失和基于 VAE 的重建损失联合训练完整模型,以提升感知质量并对齐特征分布。
实验结果
研究问题
- RQ1无文本语音转换系统是否能在无需文本标注的前提下,实现与基于文本模型相当的感知质量?
- RQ2对 WavLM 特征施加信息瓶颈在解耦内容与说话人身份方面有多有效?
- RQ3频谱图缩放数据增强是否能提升单次语音转换中提取的内容表征的纯净度?
- RQ4非预训练说话人编码器在单次语音转换中能否达到与预训练编码器相当的性能?
- RQ5与现有基线相比,所提方法在未见说话人和低质量源语音输入下的表现如何?
主要发现
- FreeVC 在未见说话人到未见说话人的场景下取得 MOS 4.35 和 SMOS 4.12,自然度和说话人相似度均优于所有基线模型。
- 所提方法的 WER 为 4.35%,CER 为 1.53%,显著低于基于文本的基线,表明其具有强大的语言内容保留能力。
- F0-PCC 达到 0.778,表明 FreeVC 比所有基线模型更好地保留了源语音的语调变化。
- FreeVC(无 SR)性能下降(MOS: 4.18,WER: 4.92%),证明基于 SR 的增强方法能有效提升解耦性和质量。
- FreeVC-s 使用非预训练说话人编码器,性能与使用预训练编码器的 FreeVC 相当,表明对说话人编码器选择具有鲁棒性。
- 该模型对低质量源语音具有鲁棒性,在基线模型性能显著下降时仍能保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。