[论文解读] Cross-lingual Multi-speaker Text-to-speech Synthesis for Voice Cloning without Using Parallel Corpus for Unseen Speakers
本文提出了一种跨语言多说话人文本到语音系统,可在无需并行数据的情况下,实现对英语和普通话中已见及未见的母语和非母语说话人的高质量语音克隆。通过在 x-vector 说话人嵌入、语言嵌入和语调/重音嵌入上进行条件控制,并对说话人嵌入使用 L2 归一化或白化处理,该模型即使在未见过的说话人上也能实现高自然度和说话人相似度,且使用在粤语上训练的 WaveNet 语音合成器,该模型在不同语言间具有良好的泛化能力。
We investigate a novel cross-lingual multi-speaker text-to-speech synthesis approach for generating high-quality native or accented speech for native/foreign seen/unseen speakers in English and Mandarin. The system consists of three separately trained components: an x-vector speaker encoder, a Tacotron-based synthesizer and a WaveNet vocoder. It is conditioned on 3 kinds of embeddings: (1) speaker embedding so that the system can be trained with speech from many speakers will little data from each speaker; (2) language embedding with shared phoneme inputs; (3) stress and tone embedding which improves naturalness of synthesized speech, especially for a tonal language like Mandarin. By adjusting the various embeddings, MOS results show that our method can generate high-quality natural and intelligible native speech for native/foreign seen/unseen speakers. Intelligibility and naturalness of accented speech is low as expected. Speaker similarity is good for native speech from native speakers. Interestingly, speaker similarity is also good for accented speech from foreign speakers. We also find that normalizing speaker embedding x-vectors by L2-norm normalization or whitening improves output quality a lot in many cases, and the WaveNet performance seems to be language-independent: our WaveNet is trained with Cantonese speech and can be used to generate Mandarin and English speech very well.
研究动机与目标
- 在无需并行训练数据的情况下,为英语和普通话中的母语和非母语说话人实现高质量的文本到语音合成。
- 通过每名说话人有限的领域内数据,支持对未见说话人的语音克隆。
- 通过语言特异性和语调嵌入提升语音自然度和说话人相似度。
- 研究说话人嵌入归一化(L2 范数、白化)对合成语音质量与说话人相似度的影响。
- 评估在一种语言(粤语)上训练的 WaveNet 语音合成器在其他语言(普通话、英语)中生成语音时的语言独立性。
提出的方法
- 该系统采用模块化流水线,包含三个独立训练的组件:x-vector 说话人编码器、基于 Tacotron 的 TTS 合成器和 WaveNet 语音合成器。
- TTS 模型通过三种嵌入进行条件控制:说话人嵌入(用于多说话人学习)、语言嵌入(共享音素输入)和语调/重音嵌入(以改善语调,尤其在普通话等声调语言中)。
- 通过 L2 范数或白化对说话人嵌入进行归一化,以提升合成质量与说话人相似度。
- WaveNet 语音合成器在粤语语音上进行训练,并用于生成普通话和英语的高保真语音,证明了其在语言间的泛化能力。
- 通过仅需几秒参考音频的未见说话人说话人嵌入进行条件控制,实现零样本语音克隆。
- 系统在公开可用的数据集上进行训练:英语使用 LibriSpeech,普通话使用 SurfingTech,确保可复现性。
实验结果
研究问题
- RQ1跨语言多说话人 TTS 系统是否能在无需并行训练数据的情况下,为已见和未见的说话人生成高质量的母语和带有口音的语音?
- RQ2说话人嵌入归一化(L2 范数、白化)如何影响合成语音的可懂度、自然度和说话人相似度?
- RQ3在一种语言(粤语)上训练的 WaveNet 语音合成器是否能有效泛化到其他语言(普通话、英语)以生成高质量语音?
- RQ4使用未见的非母语说话人时,合成语音的说话人相似度是否与母语语音相当,尤其是对非母语说话人?
- RQ5在声调语言(如普通话)中,语调和重音嵌入的引入是否显著提升了合成语音的自然度?
主要发现
- x-vector 说话人嵌入的白化处理显著提升了说话人相似度和自然度,未见的母语普通话说话人达到 4.92 MOS,未见的母语英语说话人也达到 4.92 MOS。
- 说话人嵌入的 L2 归一化提升了可懂度和语音质量,未见的母语英语说话人达到 4.92 MOS,未见的母语普通话说话人达到 4.71 MOS。
- 使用白化嵌入时,非母语英语语音(FNE)和非母语普通话语音(FNM)的说话人相似度高于母语普通话(NM),表明对口音和说话人差异具有鲁棒性。
- 在粤语上训练的 WaveNet 语音合成器能生成高质量的普通话和英语语音,证明了语音合成器性能的语言独立性。
- 带有口音的语音可懂度和自然度低于母语语音,但 L2 归一化将非母语英语语音的可懂度从无归一化时的 2.08 提升至 L2 归一化时的 4.92。
- 对于未见说话人,模型实现了较高的说话人相似度(3.81–4.08 MOS),其中白化处理效果最佳,表明其在跨语言未见说话人上具有强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。