[论文解读] Spectrum and Prosody Conversion for Cross-lingual Voice Conversion with CycleGAN
本文提出了一种基于CycleGAN的新型跨语言语音转换框架,通过F0的连续小波变换(CWT)分解联合建模频谱与语调,实现了非平行、对齐自由的训练。该方法在说话人相似度方面优于仅基于频谱的CycleGAN基线模型,表明通过CWT实现的层级语调建模显著提升了跨语言设置下的自然度与目标说话人相似度。
Cross-lingual voice conversion aims to change source speaker's voice to sound like that of target speaker, when source and target speakers speak different languages. It relies on non-parallel training data from two different languages, hence, is more challenging than mono-lingual voice conversion. Previous studies on cross-lingual voice conversion mainly focus on spectral conversion with a linear transformation for F0 transfer. However, as an important prosodic factor, F0 is inherently hierarchical, thus it is insufficient to just use a linear method for conversion. We propose the use of continuous wavelet transform (CWT) decomposition for F0 modeling. CWT provides a way to decompose a signal into different temporal scales that explain prosody in different time resolutions. We also propose to train two CycleGAN pipelines for spectrum and prosody mapping respectively. In this way, we eliminate the need for parallel data of any two languages and any alignment techniques. Experimental results show that our proposed Spectrum-Prosody-CycleGAN framework outperforms the Spectrum-CycleGAN baseline in subjective evaluation. To our best knowledge, this is the first study of prosody in cross-lingual voice conversion.
研究动机与目标
- 解决缺乏平行训练数据或说话人对齐信息时的跨语言语音转换挑战。
- 通过捕捉跨时间尺度的分层F0变化,改进跨语言语音转换中的语调建模。
- 消除对线性或统计F0变换方法的依赖,这些方法无法有效建模复杂的语调依赖关系。
- 开发一个统一框架,通过非平行数据学习频谱与语调的映射关系,采用CycleGAN实现。
- 验证基于CWT的语调表征在提升跨语言转换中说话人相似度与语音质量方面的有效性。
提出的方法
- 该框架采用两个独立的CycleGAN流水线:一个用于频谱映射,另一个用于语调映射,均在非平行数据上独立训练。
- 语调建模采用连续小波变换(CWT)将F0分解为多尺度时频系数,以捕捉短时与长时的音高轮廓。
- CWT系数被用作基于CycleGAN的语调映射网络的输入,以保留跨语言的分层语调结构。
- 频谱与语调分别通过一维和二维CNN架构的生成器与判别器处理,以保持时间与频谱纹理。
- 训练目标结合了循环一致性损失($L_{CYC}$)与身份损失($L_{ID}$),并通过超参数调优实现稳定性和性能的平衡。
- 采用两阶段训练策略:前$10^4$轮迭代仅应用$L_{ID}$,随后切换至$L_{CYC}$与$L_{ID}$联合训练。
实验结果
研究问题
- RQ1与线性或统计方法相比,基于CWT的多尺度F0表征是否能提升跨语言语音转换中的语调建模效果?
- RQ2在无需平行数据的前提下,为语调映射单独设计CycleGAN流水线是否能提升说话人相似度?
- RQ3所提出的频谱-语调CycleGAN框架在主观质量与说话人相似度方面是否优于仅基于频谱的CycleGAN?
- RQ4非平行、非对齐的训练数据是否足以实现高质量的跨语言语音转换,并提升语调迁移效果?
- RQ5在跨语言语调迁移背景下,F0的分层特性是否能被CWT分解充分捕捉?
主要发现
- 所提出的频谱-语调-CycleGAN框架在英语到中文转换中取得平均意见得分(MOS)2.92 ± 0.27,在中文到英语转换中取得3.34 ± 0.29,语音质量与仅基于频谱的基线模型相当。
- 在XAB偏好测试中,所提方法在说话人相似度方面显著优于基线模型,$en2cn$与$cn2en$两个方向的多数受试者均更偏好语调增强的输出。
- 结果表明,基于CWT的F0建模能有效捕捉不同时间尺度下的分层语调模式,从而提升自然度与目标说话人相似度。
- 通过为频谱与语调分别设计独立的CycleGAN流水线,实现了从非平行数据中有效且无需对齐的学习,验证了该框架的鲁棒性。
- 该框架是首个明确使用深度生成模型在跨语言语音转换中建模语调的工作,标志着该领域的重要进展。
- 消融实验确认,通过CWT与CycleGAN实现的语调建模对提升说话人相似度至关重要,因缺乏语调转换的基线在主观评估中表现显著更差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。