Skip to main content
QUICK REVIEW

[论文解读] Cross-speaker Emotion Transfer Based on Speaker Condition Layer Normalization and Semi-Supervised Training in Text-To-Speech

Pengfei Wu, Junjie Pan|arXiv (Cornell University)|Oct 8, 2021
Speech Recognition and Synthesis参考文献 19被引用 11
一句话总结

本文提出了一种非自回归文本到语音模型,结合说话人条件层归一化(SCLN)与使用全局风格标记(GSTs)的半监督训练,以实现可控的跨说话人情感迁移。通过利用情感标记并结合交叉熵损失与半监督微调,该方法在基线模型上实现了更高的音色相似度、更优的稳定性和情感感知能力,在主观评价和稳定性指标上均优于先前工作。

ABSTRACT

In expressive speech synthesis, there are high requirements for emotion interpretation. However, it is time-consuming to acquire emotional audio corpus for arbitrary speakers due to their deduction ability. In response to this problem, this paper proposes a cross-speaker emotion transfer method that can realize the transfer of emotions from source speaker to target speaker. A set of emotion tokens is firstly defined to represent various categories of emotions. They are trained to be highly correlated with corresponding emotions for controllable synthesis by cross-entropy loss and semi-supervised training strategy. Meanwhile, to eliminate the down-gradation to the timbre similarity from cross-speaker emotion transfer, speaker condition layer normalization is implemented to model speaker characteristics. Experimental results show that the proposed method outperforms the multi-reference based baseline in terms of timbre similarity, stability and emotion perceive evaluations.

研究动机与目标

  • 为解决任意说话人情感语音数据有限的问题,通过从带有情感语料的源说话人迁移情感到无标注的目标说话人,实现跨说话人情感迁移。
  • 在跨说话人情感迁移过程中保持高音色相似度,以避免因说话人不匹配导致的音色退化。
  • 通过情感标记的半监督训练,提升学习到的情感表征的可控性与可解释性。
  • 通过引入说话人条件层归一化(SCLN),解耦说话人与情感因素,提升合成稳定性和自然度。
  • 开发一种非自回归TTS框架,相比自回归模型,实现更优的特征解耦与更少的特征泄漏。

提出的方法

  • 采用基于并行Tacotron的架构,包含基于Transformer的文本编码器与非自回归的声谱图解码器。
  • 引入一个结合说话人与情感感知输入的时长预测器,使用Transformer模块与一维卷积层来预测音素时长。
  • 在每个LConv层与前馈层之后应用说话人条件层归一化(SCLN),其中说话人嵌入条件性地调制归一化参数(缩放与偏置)。
  • 使用参考编码器提取梅尔频谱图嵌入,随后将其作为查询,注意力机制作用于学习到的情感标记集合,生成加权情感嵌入。
  • 实施一种半监督训练策略,对情感标记施加交叉熵损失,实现可解释且可控的情感表征学习。
  • 通过重建损失、时长预测损失与情感分类器损失的组合训练,联合优化语音质量、时长准确性与情感控制。

实验结果

研究问题

  • RQ1情感标记的半监督训练是否能实现更可解释且可控的情感表征,从而提升跨说话人情感迁移效果?
  • RQ2说话人条件层归一化(SCLN)是否能有效在跨说话人情感迁移中保持音色相似度?
  • RQ3所提出的非自回归模型在特征解耦与稳定性方面,相较于自回归基线模型表现如何?
  • RQ4与多参考基线模型相比,该方法在情感感知与合成稳定性方面提升了多少?
  • RQ5该模型是否能在保持说话人身份与情感表现力的同时,泛化至多种不同情感?

主要发现

  • 所提方法在音色相似度上取得平均3.66分,显著优于基线(3.28)与M1(3.51),在整体音色相似度上较M1提升0.15分。
  • 在模糊语音稳定性指标中,所提方法将错误率降低至10.00%,相比基线(25.67%)绝对降低15.67个百分点。
  • 所提方法的总稳定性错误率为18.33%,相比基线(32.67%)降低14.34%,表明其合成可靠性更优。
  • 在情感感知评估中,所提方法获得53.24%的偏好得分,显著高于基线(40.57%),p值 < 0.01,表明用户偏好显著更强。
  • 消融研究证实,SCLN显著提升音色相似度,尤其在悲伤与愤怒等挑战性情感中表现更优;而半监督训练在不牺牲情感感知的前提下增强了稳定性。
  • 尽管音色相似度略低,所提方法在稳定性方面仍优于M2(使用半监督策略但无SCLN),总错误率18.33% vs. 27.30%,证实SCLN对实际部署的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。