[论文解读] Robust and fine-grained prosody control of end-to-end speech synthesis
本文提出了一种时间结构化的韵律嵌入网络,用于端到端文本到语音合成,实现了对基频和振幅的细粒度、帧级和音素级控制。通过从语音或文本中学习可变长度的韵律嵌入,并应用时间归一化,该方法在跨说话人韵律迁移任务中表现出色,包括歌唱语音转换,在MCD指标上相比GST Tacotron实现了29.4%的相对提升。
We propose prosody embeddings for emotional and expressive speech synthesis networks. The proposed methods introduce temporal structures in the embedding networks, thus enabling fine-grained control of the speaking style of the synthesized speech. The temporal structures can be designed either on the speech side or the text side, leading to different control resolutions in time. The prosody embedding networks are plugged into end-to-end speech synthesis networks and trained without any other supervision except for the target speech for synthesizing. It is demonstrated that the prosody embedding networks learned to extract prosodic features. By adjusting the learned prosody features, we could change the pitch and amplitude of the synthesized speech both at the frame level and the phoneme level. We also introduce the temporal normalization of prosody embeddings, which shows better robustness against speaker perturbations during prosody transfer tasks.
研究动机与目标
- 在端到端语音合成中实现对基频和振幅的细粒度、帧级和音素级韵律控制,克服固定长度韵律嵌入的局限性。
- 解决当源说话人与目标说话人的基频范围显著不同时,跨说话人韵律迁移中的鲁棒性问题。
- 通过学习韵律嵌入中的时间结构,提升韵律控制的一致性和明确性。
- 在对基频和时序高度敏感的歌唱语音中,展示有效韵律迁移的能力。
- 证明对韵律嵌入进行时间归一化可增强韵律迁移任务中的鲁棒性。
提出的方法
- 提出两种可变长度韵律嵌入:一种从语音信号中提取(语音侧),一种从文本输入中提取(文本侧),两者均与输入序列长度一致。
- 使用基于GRU的网络生成保留时间序列中韵律信息的时序韵律嵌入。
- 在训练过程中对韵律嵌入应用时间归一化,以降低对说话人特异性基频变化的敏感性。
- 将韵律嵌入网络无缝集成到端到端TTS模型(简化版Tacotron)中,无需额外监督,仅依赖目标语音。
- 采用基于内容的注意力机制计算风格令牌的贡献,通过嵌入操作实现显式的韵律控制。
- 使用13个MFCC的平均倒谱失真(MCD)作为主要评估指标,衡量韵律重建与迁移质量。
实验结果
研究问题
- RQ1可变长度韵律嵌入是否能实现在合成语音中对基频和振幅的细粒度、帧级控制?
- RQ2对韵律嵌入进行时间归一化是否能提升跨说话人韵律迁移的鲁棒性,尤其是在基频范围差异较大的情况下?
- RQ3所提出的方法能否成功将来自歌唱语音的韵律迁移到不同说话人,同时保持旋律与节奏?
- RQ4在韵律重建精度方面,所提出的韵律嵌入方法与GST Tacotron相比表现如何?
- RQ5能否通过在音素或帧级别操纵韵律嵌入值,实现显式的韵律控制?
主要发现
- 语音侧韵律控制方法实现了最低的MCD值0.294,显著优于GST Tacotron的MCD值0.413。
- 时间归一化将女性到男性的韵律迁移MCD从0.531降低至0.518,证明了鲁棒性的提升。
- 在所有帧上使用固定韵律嵌入生成了平坦但一致的语音,证实了韵律控制的显式性与可控性。
- 所提出方法成功利用从未见歌手中提取的韵律嵌入重建了歌曲的旋律,而GST Tacotron未能实现此目标。
- 语音侧韵律控制生成的音频与原歌曲几乎完全一致,表明在歌唱任务中实现了高保真度的韵律迁移。
- 该方法在帧级和音素级均实现了稳定的韵律控制,相同音素之间未出现意外的韵律变化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。