[论文解读] Controllable neural text-to-speech synthesis using intuitive prosodic features
本文提出了一种统一的端到端神经TTS系统,通过在序列到序列模型上条件化句子级声学特征(音高、音高范围、时长、能量和频谱倾斜度),实现了对语调的直观、解耦控制。该模型在保持相近自然度(MOS 4.23 vs. 基线4.26)的同时,通过直接操纵语调维度实现了多样化的语调风格。
Modern neural text-to-speech (TTS) synthesis can generate speech that is indistinguishable from natural speech. However, the prosody of generated utterances often represents the average prosodic style of the database instead of having wide prosodic variation. Moreover, the generated prosody is solely defined by the input text, which does not allow for different styles for the same sentence. In this work, we train a sequence-to-sequence neural network conditioned on acoustic speech features to learn a latent prosody space with intuitive and meaningful dimensions. Experiments show that a model conditioned on sentence-wise pitch, pitch range, phone duration, energy, and spectral tilt can effectively control each prosodic dimension and generate a wide variety of speaking styles, while maintaining similar mean opinion score (4.23) to our Tacotron baseline (4.26).
研究动机与目标
- 解决端到端神经TTS系统中缺乏显式语调控制的问题,此类系统常产生平均化的语调风格。
- 通过将语调与语言内容解耦,使同一文本能够生成多样化的语调风格。
- 基于感知上有意义的、解耦的声学特征(而非潜在嵌入)开发语调控制机制。
- 通过允许非专家直观调节语调,提升语音助手应用的可用性。
- 通过使用与录音条件和背景噪声无关的特征,确保系统的鲁棒性。
提出的方法
- 将Tacotron风格的编码器-解码器模型基于从输入文本中预测的语调特征(音高、音高范围、音节时长、能量、频谱倾斜度)进行条件化。
- 训练模型直接从编码器输出预测这些语调特征,从而实现从文本端到端学习语调。
- 使用共享的潜在空间进行语调建模,其中每个特征独立且可控地预测。
- 为每个语调特征应用范围在[-1, 1]之间的偏置参数,以实现对语调风格的直观控制。
- 使用大规模数据集(52小时语音)进行训练,包含对齐的文本与语调特征。
- 采用改进的损失函数,以增强目标与生成语调特征之间的对齐,提升控制精度。
实验结果
研究问题
- RQ1能否通过直观、感知上有意义的声学特征而非潜在嵌入来有效控制语调?
- RQ2通过显式特征控制语调是否能保持或提升与标准Tacotron基线相比的语音自然度?
- RQ3无音频专业知识的用户在使用直观的语调调节工具时,能在多大程度上生成更具表现力或更合适的合成语音?
- RQ4在音高、时长和能量的极端取值下,语调控制的鲁棒性如何?
- RQ5该模型能否在无需参考音频或人工标注的情况下,生成感知上明显不同且可用的语调风格?
主要发现
- 所提模型的平均意见得分(MOS)为4.23,几乎与Tacotron基线(4.26)相当,表明语音自然度相近。
- 客观分析证实,目标语调特征值与合成语音中测量的语调特征值之间存在强相关性。
- 听众更偏好经过语调修改的合成语音,选择比例达63%;在44%的情况下,更偏好合成语音而非原始录音。
- 极端语调设置(如音高偏置=1.0或低能量)导致性能下降,如持续高音或耳语般语音,表明语音产生存在生理极限。
- 该模型实现了对每个语调维度的解耦、独立控制,支持对语调风格的直观调节。
- 该系统在语音助手应用中展现出实际应用价值,使非专家能够生成更具表现力且更符合语境的语音。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。