[论文解读] Fine-grained style control in Transformer-based Text-to-speech Synthesis
该论文提出了一种基于Transformer的文本到语音系统,通过引入从参考语音中提取的局部风格标记(LST),实现了细粒度的风格控制。该方法利用交叉注意力模块融合内容与风格表征,减少了内容泄漏,提升了自然度、可懂度和风格迁移能力——在LJ Speech和VCTK数据集上实现了最先进性能,且无需额外正则化。
In this paper, we present a novel architecture to realize fine-grained style control on the transformer-based text-to-speech synthesis (TransformerTTS). Specifically, we model the speaking style by extracting a time sequence of local style tokens (LST) from the reference speech. The existing content encoder in TransformerTTS is then replaced by our designed cross-attention blocks for fusion and alignment between content and style. As the fusion is performed along with the skip connection, our cross-attention block provides a good inductive bias to gradually infuse the phoneme representation with a given style. Additionally, we prevent the style embedding from encoding linguistic content by randomly truncating LST during training and using wav2vec 2.0 features. Experiments show that with fine-grained style control, our system performs better in terms of naturalness, intelligibility, and style transferability. Our code and samples are publicly available.
研究动机与目标
- 在基于Transformer的文本到语音合成中,实现对语调、语速和音量等说话风格的细粒度控制。
- 解决风格建模中的内容泄漏问题,即在训练过程中语言内容意外泄露到风格嵌入中。
- 设计一种能够捕捉时变、帧级语调变化的风格表征,而不过度依赖全局风格嵌入。
- 通过内容与风格表征的交叉注意力机制融合,提升语音质量与风格迁移能力。
- 证明系统在多说话人设置下具有泛化能力,并可在无情感或风格标签的情况下实现零样本风格迁移。
提出的方法
- 风格网络使用wav2vec 2.0作为参考语音的特征提取器,提供鲁棒且解耦的表征,减少内容泄漏。
- 通过可学习的码本和多头注意力机制学习局部风格标记(LST),生成帧级风格嵌入序列。
- 交叉注意力模块将音素表征与LST嵌入融合,通过跳跃连接和归纳偏置实现风格的渐进式注入。
- 通过在训练期间随机截断LST并使用wav2vec 2.0特征而非原始波形或谱图,缓解内容泄漏。
- 系统采用仅包含音素嵌入和层归一化的内容网络,解码器网络与MultiSpeech相似。
- 通过同时对内容和风格表征进行条件控制,实现说话风格的独立调控。

实验结果
研究问题
- RQ1能否在不引入内容泄漏的前提下,有效将细粒度、帧级的说话风格控制集成到基于Transformer的TTS系统中?
- RQ2内容与风格表征之间的交叉注意力融合机制在多大程度上提升了语音的自然度与可懂度?
- RQ3该系统在多大程度上能够将参考语音中的细微语调变化(如语速和音量)有效迁移到合成语音中?
- RQ4与传统的谱图或基于嵌入的输入相比,使用wav2vec 2.0特征作为表征主干是否能更有效地减少内容泄漏?
- RQ5系统是否能在多说话人设置下实现泛化,并在无显式情感或风格标注的情况下保持高质量的风格迁移?
主要发现
- LST-A变体在LJ Speech上实现了自然度MOS为3.62 ± 0.09,风格相似度MOS为3.28 ± 0.10,优于包括Tan et al. [10]在内的先前方法。
- 在VCTK数据集上,LST-A设置下系统保持高性能,自然度MOS为3.75 ± 0.10,风格相似度MOS为3.25 ± 0.12。
- 使用预训练的SER分类器进行情感标签转移,准确率达到68.4%,表明系统在无情感监督下仍能有效迁移情感模式。
- 训练期间随机截断LST(LST-R)未降低语音可懂度,证实风格控制对序列依赖关系不敏感,具有鲁棒性。
- SPK变体因内容表征被调整以包含语调信息,导致WER升高,表明对对齐学习具有更强的鲁棒性。
- 系统在多说话人设置下泛化良好,LST-A与LST-S在VCTK上均保持低WER,且在内容与风格输入来自不同说话人时仍能维持高风格相似度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。