[论文解读] Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation
Meta-StyleSpeech在 StyleSpeech 的基础上扩展了元学习和判别器,以实现对多说话人 TTS 的强一-shot、短参考说话人适应。即使参考音频少于 1 秒,也能提供高质量、与说话人一致的合成。
With rapid progress in neural text-to-speech (TTS) models, personalized speech generation is now in high demand for many applications. For practical applicability, a TTS model should generate high-quality speech with only a few audio samples from the given speaker, that are also short in length. However, existing methods either require to fine-tune the model or achieve low adaptation quality without fine-tuning. In this work, we propose StyleSpeech, a new TTS model which not only synthesizes high-quality speech but also effectively adapts to new speakers. Specifically, we propose Style-Adaptive Layer Normalization (SALN) which aligns gain and bias of the text input according to the style extracted from a reference speech audio. With SALN, our model effectively synthesizes speech in the style of the target speaker even from single speech audio. Furthermore, to enhance StyleSpeech's adaptation to speech from new speakers, we extend it to Meta-StyleSpeech by introducing two discriminators trained with style prototypes, and performing episodic training. The experimental results show that our models generate high-quality speech which accurately follows the speaker's voice with single short-duration (1-3 sec) speech audio, significantly outperforming baselines.
研究动机与目标
- 激发高质量、富表达的多说话人 TTS,能够仅用少量短音频样本就适应新的说话人。
- 引入一种风格自适应归一化机制,以使合成以参考说话人的声音和韵律为条件。
- 通过带对抗判别器和风格原型的元学习,优化对未见说话人的适应。
- 在已见和未见说话人任务上展示最前沿的性能,包括极短参考音频场景。
提出的方法
- 提出带有 Style-Adaptive Layer Normalization (SALN) 的 StyleSpeech,以基于从参考语音提取的风格向量对特征的增益和偏置进行对齐。
- 通过添加带风格原型的风格判别器和一个音素判别器,将 StyleSpeech 扩展为 Meta-StyleSpeech,使其能够进行面向 episodic 的元学习以实现一-shot 适应。
- 使用 mel-style 编码器从参考语音提取风格向量,并将 SALN 输入到基于 FFT 的音素编码器和 FastSpeech2 为基础的生成器的梅尔声谱解码器。
- 在已见说话人上进行重建损失训练,在未见说话人适应方面来自两个判别器的对抗损失(LS-GAN),以及一个风格原型分类目标。
- 通过每个 episode 模拟 support/query 拆分来进行 episodic 训练,以提升对未见说话人的泛化能力。
实验结果
研究问题
- RQ1StyleSpeech 是否能够在使用单个短参考音频的情况下合成高质量的多说话人语音并适应新说话人?
- RQ2与非元学习基线相比,带判别器的元学习是否提升了对未见说话人的适应质量?
- RQ3参考语音的长度如何影响未见说话人的适应准确性和语音相似度?
- RQ4风格判别器、音素判别器以及风格原型对未见说话人适应的贡献是什么?
- RQ5在有监督和无监督条件下,生成语音在客观和主观指标上与目标说话人的声音有多接近?
主要发现
- StyleSpeech 在已见说话人上的 MOS 更高,MCD/WER 低于基线。
- Meta-StyleSpeech 在已见说话人上达到评估模型中最佳表现。
- 对于未见说话人,Meta-StyleSpeech 在 MOS、MCD、WER 和语音相似度方面优于基线。
- 参考音频长度小于 1 秒的适应被 Meta-StyleSpeech 显著提升,在所有参考长度上均优于 StyleSpeech。
- 消融研究表明音素判别器、风格判别器以及风格原型对未见说话人适应的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。