[论文解读] Daft-Exprt: Robust Prosody Transfer Across Speakers for Expressive Speech Synthesis.
Daft-Exprt 是一种多说话人声学模型,通过使用 FiLM 条件化和对抗性训练,实现了说话人之间韵律的改进迁移,成功将韵律与说话人身份解耦。该模型在跨说话人和跨文本的韵律迁移任务中达到最先进性能,同时保持自然的语音质量,代码和语音样本已公开发布。
This paper presents Daft-Exprt, a multi-speaker acoustic model advancing the state-of-the-art on inter-speaker and inter-text prosody transfer. This improvement is achieved using FiLM conditioning layers, alongside adversarial training that encourages disentanglement between prosodic information and speaker identity. The acoustic model inherits attractive qualities from FastSpeech 2, such as fast inference and local prosody attributes prediction for finer grained control over generation. Experimental results show that Daft-Exprt significantly outperforms strong baselines on prosody transfer tasks, while yielding naturalness comparable to state-of-the-art expressive models. Moreover, results indicate that adversarial training effectively discards speaker identity information from the prosody representation, which ensures Daft-Exprt will consistently generate speech with the desired voice. We publicly release our code and provide speech samples from our experiments.
研究动机与目标
- 在保持说话人身份的同时,改进表达性语音合成中不同说话人之间的韵律迁移。
- 通过对抗性训练将韵律信息与说话人身份解耦。
- 受 FastSpeech 2 启发,保持快速推理和细粒度的韵律控制。
- 实现与最先进表达性模型相当的自然度。
- 通过从韵律表征中移除说话人身份,实现一致的语音生成。
提出的方法
- 使用 FiLM 条件化层,根据韵律条件向量调制声学模型。
- 采用对抗性训练,促使模型从韵律表征中丢弃说话人身份信息。
- 采用 FastSpeech 2 的架构以实现快速推理和局部韵律预测。
- 训练判别器以区分真实和生成的韵律表征,促进解耦。
- 采用多说话人设置,共享声学建模并使用说话人特定的条件化。
- 整合端到端训练,损失函数包含重建损失、对抗损失和持续时间预测损失。
实验结果
研究问题
- RQ1FiLM 条件化是否能提升表达性语音合成中不同说话人之间的韵律迁移?
- RQ2对抗性训练是否能有效从潜在表征中解耦韵律内容与说话人身份?
- RQ3该模型是否能在实现优越韵律迁移性能的同时保持高自然度?
- RQ4在生成具有迁移韵律的语音时,该模型在多大程度上保留了说话人身份?
- RQ5该模型在跨说话人和跨文本韵律迁移任务中与强基线模型相比表现如何?
主要发现
- Daft-Exprt 在跨说话人和跨文本韵律迁移任务中显著优于强基线模型。
- 对抗性训练成功从韵律表征中移除说话人身份,确保了语音生成的一致性。
- 该模型实现了与最先进表达性语音合成模型相当的自然度。
- FiLM 条件化实现了语音生成过程中对韵律属性的细粒度控制。
- 由于其受 FastSpeech 2 启发的架构,该模型保持了快速推理速度。
- 代码和语音样本的公开发布促进了可复现性与进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。