[论文解读] StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis
StyleTTS 提出了一种基于风格的生成模型,用于自然且多样的文本到语音合成,采用一种新型的可迁移单调对齐器(TMA)和基于 AdaIN 的参考语音风格整合。通过实现零样本风格迁移和无需显式韵律标签的鲁棒、快速并行推理,该模型在语音自然度和说话人相似度方面达到了最先进水平。
Text-to-Speech (TTS) has recently seen great progress in synthesizing high-quality speech owing to the rapid development of parallel TTS systems, but producing speech with naturalistic prosodic variations, speaking styles and emotional tones remains challenging. Moreover, since duration and speech are generated separately, parallel TTS models still have problems finding the best monotonic alignments that are crucial for naturalistic speech synthesis. Here, we propose StyleTTS, a style-based generative model for parallel TTS that can synthesize diverse speech with natural prosody from a reference speech utterance. With novel Transferable Monotonic Aligner (TMA) and duration-invariant data augmentation schemes, our method significantly outperforms state-of-the-art models on both single and multi-speaker datasets in subjective tests of speech naturalness and speaker similarity. Through self-supervised learning of the speaking styles, our model can synthesize speech with the same prosodic and emotional tone as any given reference speech without the need for explicitly labeling these categories.
研究动机与目标
- 为解决文本到语音系统中生成富有表现力、自然且多样的语音,尤其是韵律和情感变化的挑战。
- 克服现有并行 TTS 模型在单调对齐和风格解耦方面存在的局限。
- 实现在无情感或韵律显式标签情况下的零样本说话人适应和风格迁移。
- 通过迁移学习和时长无关的数据增强,提升对齐鲁棒性和韵律建模能力。
- 通过使用参考语音提取的自适应实例归一化(AdaIN)实现通用说话风格整合,支持一对一至多对多的语音合成。
提出的方法
- 提出一种可迁移单调对齐器(TMA),通过混合软硬注意力机制,在 TTS 数据上微调预训练的文本对齐器,以提升对齐精度。
- 采用时长无关的数据增强方案,通过使模型对次优时长预测具有鲁棒性,增强韵律建模能力。
- 使用 AdaIN 条件化解码器和预测器,基于从参考语音中提取的风格向量,实现包括音高、能量和语速在内的丰富风格迁移。
- 应用自监督风格表征学习,从参考语音中反映情感和韵律特征,而无需显式标注。
- 采用两阶段训练:第一阶段使用风格、音高、能量、音素和对齐信息重建梅尔频谱图;第二阶段端到端联合预测音高、能量和对齐信息。
- 利用迁移学习,结合预训练组件(如文本对齐器、音高提取器)以缓解小规模 TTS 数据集上的过拟合问题。
实验结果
研究问题
- RQ1可迁移单调对齐器是否能在不依赖外部对齐器的情况下,提升非自回归 TTS 中的对齐质量?
- RQ2时长无关的数据增强是否能提升韵律建模能力并增强对时长预测误差的鲁棒性?
- RQ3基于参考语音的 AdaIN 风格整合是否能有效迁移韵律和情感特征,而无需显式标签?
- RQ4StyleTTS 在多大程度上能实现零样本说话人适应和跨说话人、跨说话风格的多样化风格迁移?
- RQ5残差特征、归一化类型和风格拼接等架构选择如何影响语音自然度和风格相关性?
主要发现
- 与 100% 硬对齐相比,TMA 在语音质量上显著提升,MOS 得分提高 +0.26,且避免了 100% 软注意力中出现的过拟合现象。
- 移除预训练文本对齐器导致 MOS 下降 -0.39,证明了迁移学习在小规模 TTS 数据集上缓解过拟合的有效性。
- 时长无关的数据增强提升了韵律建模能力,其移除导致性能明显下降。
- 将 AdaIN 替换为简单拼接或实例归一化,使风格相关性下降超过 20%,且自然度下降,证实了 AdaIN 在风格迁移中的优越性。
- 移除判别器导致感知音质显著下降,凸显了对抗训练在语音质量中的重要性。
- 在主观测试中,该模型在说话人相似度和自然度方面表现优异,MOS 得分在单说话人和多说话人数据集上均超过基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。