Skip to main content
QUICK REVIEW

[论文解读] CUHK-EE Voice Cloning System for ICASSP 2021 M2VoC Challenge

Daxin Tan, Hing-Pang Huang|arXiv (Cornell University)|Mar 8, 2021
Speech Recognition and Synthesis参考文献 20被引用 4
一句话总结

本论文介绍了香港城市大学EE团队在ICASSP 2021年M2VoC挑战赛中提出的CUHK-EE语音克隆系统,该系统采用混合Tacotron2与DurIAN声学模型,并结合Hifigan声码器,实现端到端语音克隆。该系统采用多说话人训练,利用100句目标语音进行说话人自适应,并引入时长预测器,以实现较强的说话人相似度与风格迁移,其在1b赛道上的说话人相似度评分为3.8365 MOS,风格相似度评分为3.6163 MOS,在22支参赛队伍中排名第13位。

ABSTRACT

This paper presents the CUHK-EE voice cloning system for ICASSP 2021 M2VoC challenge. The challenge provides two Mandarin speech corpora: the AIShell-3 corpus of 218 speakers with noise and reverberation and the MST corpus including high-quality speech of one male and one female speakers. 100 and 5 utterances of 3 target speakers in different voice and style are provided in track 1 and 2 respectively, and the participants are required to synthesize speech in target speaker's voice and style. We take part in the track 1 and carry out voice cloning based on 100 utterances of target speakers. An end-to-end voicing cloning system is developed to accomplish the task, which includes: 1. a text and speech front-end module with the help of forced alignment, 2. an acoustic model combining Tacotron2 and DurIAN to predict melspectrogram, 3. a Hifigan vocoder for waveform generation. Our system comprises three stages: multi-speaker training stage, target speaker adaption stage and target speaker synthesis stage. Our team is identified as T17. The subjective evaluation results provided by the challenge organizer demonstrate the effectiveness of our system. Audio samples are available at our demo page: https://daxintan-cuhk.github.io/CUHK-EE-system-M2VoC-challenge/ .

研究动机与目标

  • 开发一种鲁棒的端到端语音克隆系统,能够在数据有限的情况下合成目标说话人的语音与风格。
  • 探究结合Tacotron2与DurIAN在低资源语音克隆中提升韵律与对齐效果的有效性。
  • 评估外部数据在零样本或少样本设置下对语音克隆性能的影响。
  • 在训练条件受限的情况下,实现高说话人相似度与高质量的风格迁移。

提出的方法

  • 文本与语音前端模块使用pypinyin进行音素到音素转换,并利用Montreal Forced Aligner(MFA)进行音素级别的强制对齐,以提取真实时长。
  • 声学模型结合Tacotron2与DurIAN,通过在音素序列和真实时长上训练显式时长预测器,以改善对齐与韵律。
  • 在目标说话人自适应阶段,使用真实波形与自适应声学模型生成的梅尔频谱图对预训练的Hifigan声码器进行微调。
  • 系统采用三阶段流程:多说话人训练、使用100句语音进行目标说话人自适应,以及在1a赛道中不使用外部数据、在1b赛道中使用外部数据进行目标说话人语音合成。
  • 时长预测器使用双向LSTM与全连接层,通过均方误差(MSE)损失函数,从音素序列预测帧级时长。
  • 声码器自适应过程持续3000步,使用自适应声学模型输出的梅尔频谱图与对应的真实波形进行训练。

实验结果

研究问题

  • RQ1在目标说话人数据有限的情况下,混合Tacotron2与DurIAN的声学模型在少样本语音克隆中的有效性如何?
  • RQ2当仅使用100句语音对多说话人TTS系统进行微调时,说话人与风格相似度能保持到何种程度?
  • RQ3在语音质量、说话人相似度与风格迁移方面,引入外部数据是否能显著提升语音克隆性能?
  • RQ4在端到端TTS语音克隆中,基于强制对齐训练的时长预测器在改善对齐与韵律方面表现如何?

主要发现

  • 在1a赛道中,系统在语音质量方面的平均意见得分(MOS)为3.5845 ± 0.0563,位列18个提交系统中的第11名。
  • 在1b赛道中,使用外部数据后,系统在语音质量方面的MOS得分为3.9630 ± 0.0468,位列22支队伍中的第13名。
  • 在说话人相似度方面,系统在1a赛道中得分为3.7470 ± 0.0499(18支队伍中第10名),在1b赛道中得分为3.8365 ± 0.0499(22支队伍中第13名)。
  • 在风格相似度方面,系统在1a赛道中得分为3.6840 ± 0.0410(18支队伍中第12名),在1b赛道中得分为3.6163 ± 0.0417(22支队伍中第15名)。
  • 结果表明,尽管系统表现合理,但在说话人相似度与风格相似度方面仍有显著提升空间。
  • 1b赛道中引入外部数据后,所有MOS指标均实现可测量的提升,表明其在低资源语音克隆中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。