[论文解读] Predicting Expressive Speaking Style From Text In End-To-End Speech Synthesis
本文提出文本预测全局风格标记(TP-GST),一种端到端的文本到语音合成方法,仅通过文本预测富有表现力的语调风格,推理时无需显式风格标签或辅助输入。该模型在人类偏好测试中表现出比基线模型更自然的语调,且具有更高的音高和能量变化,尤其在有声书合成任务中表现优异。
Global Style Tokens (GSTs) are a recently-proposed method to learn latent disentangled representations of high-dimensional data. GSTs can be used within Tacotron, a state-of-the-art end-to-end text-to-speech synthesis system, to uncover expressive factors of variation in speaking style. In this work, we introduce the Text-Predicted Global Style Token (TP-GST) architecture, which treats GST combination weights or style embeddings as "virtual" speaking style labels within Tacotron. TP-GST learns to predict stylistic renderings from text alone, requiring neither explicit labels during training nor auxiliary inputs for inference. We show that, when trained on a dataset of expressive speech, our system generates audio with more pitch and energy variation than two state-of-the-art baseline models. We further demonstrate that TP-GSTs can synthesize speech with background noise removed, and corroborate these analyses with positive results on human-rated listener preference audiobook tasks. Finally, we demonstrate that multi-speaker TP-GST models successfully factorize speaker identity and speaking style. We provide a website with audio samples for each of our findings.
研究动机与目标
- 开发一种文本到语音系统,能够在推理时无需显式风格标注或外部输入,即可生成富有表现力的语调风格。
- 通过从原始文本中学习的潜在表征,将说话风格与说话人身份及背景噪声解耦。
- 实现端到端语音合成,使富有表现力的语调直接从文本预测生成,从而提升自然度与听众偏好。
- 证明风格标记可在不同说话人之间共享,同时保持说话人身份特征并支持风格迁移。
提出的方法
- TP-GST架构在Tacotron基础上引入两条路径:一条通过交叉熵损失预测GST组合权重,另一条通过L1损失预测风格嵌入。
- 模型使用一组可学习的共享风格标记,以捕捉全局语调变化,如音高、能量和语速。
- 训练过程中,模型最小化包含Tacotron原始损失和基于GST权重或风格嵌入的额外风格预测损失的联合损失函数。
- 推理时仅依赖文本嵌入作为条件,实现无需任何辅助信号或人工风格选择的风格预测。
- 多说话人TP-GST模型将说话人身份嵌入作为输入条件,同时在不同说话人之间共享同一套风格标记。
- 该方法通过共享的可学习风格标记,实现说话人身份、说话风格与背景噪声的解耦建模。
实验结果
研究问题
- RQ1能否仅从文本中预测富有表现力的语调风格,而无需显式风格标注或辅助输入?
- RQ2TP-GST模型能否在共享潜在空间中将说话风格与说话人身份及背景噪声解耦?
- RQ3与基线TTS模型相比,基于文本预测的风格生成是否能带来更自然的语调和更高的听众偏好?
- RQ4多说话人TP-GST模型能否在保持说话人身份的同时,实现在不同语音之间的富有表现力的风格迁移?
主要发现
- TP-GST模型生成的语音在音高和能量变化上显著优于两种最先进基线模型,表明其语调表现力更强。
- 在主观偏好评估中,人类听者更偏好TP-GST生成的有声书语音,而非基线Tacotron模型。
- 定性与定量分析均证实,该模型在语音合成过程中成功去除了背景噪声。
- 多说话人TP-GST模型成功将说话人身份与说话风格解耦,保持说话人身份的同时支持跨说话人的风格迁移。
- 音频样本显示,对单个风格标记进行条件控制可产生显著不同的语调特征,包括音高、能量和语速的差异。
- 该系统在不同语调风格(包括富有表现力的有声书、中性新闻播报及助手风格语音)上均表现出良好的泛化能力,即使在混合数据上进行训练亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。