[论文解读] Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis
本文提出一个多说话人 TTS 系统,将说话人表示与合成解耦,使用预训练的说话人编码器实现对未见说话人的零样本合成,通过基于 Tacotron 2 的合成器和 WaveNet 声码器。结果表明,大规模、覆盖面广且未标注的说话人数据集能够提升对新语音的泛化能力。
We describe a neural network-based system for text-to-speech (TTS) synthesis that is able to generate speech audio in the voice of many different speakers, including those unseen during training. Our system consists of three independently trained components: (1) a speaker encoder network, trained on a speaker verification task using an independent dataset of noisy speech from thousands of speakers without transcripts, to generate a fixed-dimensional embedding vector from seconds of reference speech from a target speaker; (2) a sequence-to-sequence synthesis network based on Tacotron 2, which generates a mel spectrogram from text, conditioned on the speaker embedding; (3) an auto-regressive WaveNet-based vocoder that converts the mel spectrogram into a sequence of time domain waveform samples. We demonstrate that the proposed model is able to transfer the knowledge of speaker variability learned by the discriminatively-trained speaker encoder to the new task, and is able to synthesize natural speech from speakers that were not seen during training. We quantify the importance of training the speaker encoder on a large and diverse speaker set in order to obtain the best generalization performance. Finally, we show that randomly sampled speaker embeddings can be used to synthesize speech in the voice of novel speakers dissimilar from those used in training, indicating that the model has learned a high quality speaker representation.
研究动机与目标
- 学习一个说话人编码器,从简短、未转录的参考音频中捕捉说话人特征。
- 在没有合成数据转录文本的情况下,训练一个以说话人嵌入为条件的多说话人 TTS 合成器。
- 展示对训练中未见的说话人实现零样本声线迁移。
- 使用 MOS 和说话人验证指标评估自然度和说话人相似性。
- 分析说话人编码器训练数据的规模与多样性如何影响迁移质量。
提出的方法
- 三个组件的独立训练:一个基于说话人验证、使用未转录的有噪声数据进行训练的说话人编码器;一个以说话人嵌入为条件的基于 Tacotron 2 的序列到序列合成器;以及一个将 Mel 谱图转换为波形的 WaveNet 声码器。
- 说话人嵌入来自简短的参考语音(秒级),并在每个时间步用于对合成器进行条件化。
- 训练采用迁移学习设置,在训练合成器时固定说话人编码器,合成目标的文本到谱图来自音素序列。
- 使用结合的 L2(谱图)和 L1 损失来训练合成目标,以提高对嘈杂数据的鲁棒性。
- 评估包括对未见说话人进行的主观自然度和相似性的 MOS,以及客观的说话人验证 EER。
实验结果
研究问题
- RQ1是否能够通过从大规模、未转录数据中学习的单独训练的说话人编码器实现对未见说话人的零样本多说话人 TTS?
- RQ2说话人编码器训练数据的多样性和规模如何影响合成语音的自然度和说话人相似性?
- RQ3系统在多大程度上能够将说话人特征迁移到训练中未见的声音,包括跨不同噪声水平和口音的数据集?
主要发现
- 所提出的模型在 VCTK 和 LibriSpeech 上对见过的和未见过的说话人均实现大约 4.0 MOS。
- 在 LibriSpeech 上,未见说话人的自然度达到 4.12 MOS,接近已见说话人的性能,而 VCTK 因数据更干净而显示出更强的相似性。
- 未见说话人的相似性下降,在 LibriSpeech 上测试时 MOS 较低;当合成器用更多样的说话人数据训练时,相似性提升(如 LibriSpeech 与 VoxCeleb 的组合)。
- 使用一个大规模、多样化、预训练的说话人编码器(在数千名说话人上训练)显著提升零样本迁移质量,并能够从与训练数据不同的虚构说话人进行生成。
- 跨数据集评估表明,LibriSpeech 训练的合成器比 VCTK 训练的在未见数据上具有更好的泛化能力,凸显了多样化训练源的重要性。
- 说话人验证的 EER 表明 LibriSpeech 训练的合成器生成的声音比 VCTK 训练的更接近真实说话人,且合成声音通常不会与真实声音混淆。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。