Skip to main content
QUICK REVIEW

[论文解读] Towards Multi-Scale Style Control for Expressive Speech Synthesis

Xiang Li, Changhe Song|arXiv (Cornell University)|Apr 8, 2021
Speech Recognition and Synthesis参考文献 17被引用 4
一句话总结

本文提出了一种用于端到端表达性TTS的多尺度参考编码器,可联合从参考语音中提取全局风格嵌入(GSE)和局部韵律嵌入(LPE),从而实现对话语级情感与细粒度韵律的同步控制。该方法提升了风格迁移的准确性和鲁棒性,尤其在跨情感和非平行设置下表现更优,在客观与主观评估中均优于单尺度基线模型。

ABSTRACT

This paper introduces a multi-scale speech style modeling method for end-to-end expressive speech synthesis. The proposed method employs a multi-scale reference encoder to extract both the global-scale utterance-level and the local-scale quasi-phoneme-level style features of the target speech, which are then fed into the speech synthesis model as an extension to the input phoneme sequence. During training time, the multi-scale style model could be jointly trained with the speech synthesis model in an end-to-end fashion. By applying the proposed method to style transfer task, experimental results indicate that the controllability of the multi-scale speech style model and the expressiveness of the synthesized speech are greatly improved. Moreover, by assigning different reference speeches to extraction of style on each scale, the flexibility of the proposed method is further revealed.

研究动机与目标

  • 解决现有表达性TTS模型仅关注语音风格单一尺度(全局或局部)的局限性,导致对话语级情感或细粒度韵律控制能力不足。
  • 开发一种统一的、可端到端训练的框架,同时建模全局尺度(如说话人音色、情感)和局部尺度(如基频、能量、停顿)的风格特征。
  • 通过参考注意力机制将多尺度风格特征集成到TTS主干网络中,提升合成语音的可控性与表现力。
  • 实现灵活的风格迁移,支持使用多个参考语音——例如,从一个参考中提取全局情感,从另一个中提取局部韵律——而无需依赖平行数据。

提出的方法

  • 设计了一种多尺度参考编码器,用于从参考语音的梅尔频谱图中同时提取全局风格嵌入(GSE)向量和局部韵律嵌入(LPE)序列。
  • 参考编码器采用步长大于1的卷积层对输入频谱图进行下采样,生成粒度更接近音素(准音素尺度)的中间特征,从而提升与音素单元的对齐精度。
  • 通过参考注意力机制将LPE序列对齐到音素序列,其机制与注意力机制TTS中的内容注意力相似。
  • 多尺度参考编码器与参考注意力机制与TTS模型联合端到端训练,实现风格建模与语音生成的联合优化。
  • 通过为全局与局部风格组件分配不同的参考语音,支持非平行与跨情感风格迁移。
  • 模型架构采用具有编码器-解码器结构的TTS主干网络,其中风格特征与音素嵌入拼接,用于条件生成。

实验结果

研究问题

  • RQ1统一的端到端TTS系统是否能有效建模全局与局部语音风格特征,而无需依赖辅助标签或分阶段训练?
  • RQ2多尺度风格建模在提升合成语音对全局情感与细粒度韵律的可控性方面有何改善?
  • RQ3使用准音素尺度风格特征(而非帧尺度)在多大程度上增强了参考注意力与语音合成的鲁棒性与准确性?
  • RQ4模型是否能通过组合来自不同参考语音的全局与局部风格组件,实现灵活的风格迁移,即使这些参考语音非平行?
  • RQ5与单尺度基线模型(如仅全局或仅局部)相比,该方法在客观与主观评估中的表现如何?

主要发现

  • 所提出的多尺度模型在全局情感与局部韵律迁移方面显著优于单尺度基线模型,该结论得到平均意见评分(MOS)评估的验证。
  • 主观评估显示,与基线相比,所提模型在全局情感(平均MOS:4.21)与局部韵律(平均MOS:4.15)方面均获得了更高的相似度评分。
  • 模型成功实现了跨情感风格迁移,即从一个参考中迁移全局情感,同时保留另一个参考的局部韵律,展现出高度灵活性。
  • 准音素尺度的LPE表示带来了更鲁棒的参考注意力对齐,避免了在合成最终音素时出现错误——而帧尺度基线(Base-FS)在某些情况下无法生成最后一个字符。
  • 在非平行风格迁移中,模型保持了高质量与连贯性,表明其能泛化至平行训练数据之外,并有效处理多样化的参考输入。
  • 消融实验表明,若移除下采样(即恢复为帧尺度),将导致参考注意力对齐与语音质量下降,验证了准音素尺度粒度的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。