[论文解读] Prosody Transfer in Neural Text to Speech Using Global Pitch and Loudness Features
本文提出了一种简单而有效的方法,通过使用从参考音频中提取的全局音高和响度特征,对Tacotron2(TC2)合成器进行条件控制,实现神经文本到语音(TTS)中的韵律迁移。该方法仅使用七个汇总统计量(对数F0和RMS能量)来实现韵律迁移,实现了高自然度和与参考音频高度相似的韵律,客观指标显示相比基线TC2有显著提升。
This paper presents a simple yet effective method to achieve prosody transfer from a reference speech signal to synthesized speech. The main idea is to incorporate well-known acoustic correlates of prosody such as pitch and loudness contours of the reference speech into a modern neural text-to-speech (TTS) synthesizer such as Tacotron2 (TC2). More specifically, a small set of acoustic features are extracted from reference audio and then used to condition a TC2 synthesizer. The trained model is evaluated using subjective listening tests and a novel objective evaluation of prosody transfer is proposed. Listening tests show that the synthesized speech is rated as highly natural and that prosody is successfully transferred from the reference speech signal to the synthesized signal.
研究动机与目标
- 实现可控制韵律的表达性文本到语音(TTS)合成,使其具有类人表达性。
- 解决标准TTS模型仅从训练数据中学习到中性韵律的局限性。
- 开发一种低资源、易于使用的韵律迁移方法,将参考语音信号的韵律迁移到合成语音中。
- 引入新的客观指标,用于评估神经TTS中韵律迁移的性能。
- 证明一小撮全局声学特征可有效调节神经TTS模型,实现表达性语音合成。
提出的方法
- 使用一种简单、非学习的汇总统计量编码器,从参考语音信号中提取全局韵律特征——对数F0(音高)和RMS(响度)能量。
- 通过将这些特征与文本编码器隐藏状态逐元素相加,对Tacotron2(TC2)TTS模型进行条件控制。
- 使用轻量级线性变换将参考语音的韵律特征映射为7维全局汇总向量(在7个时间点的对数F0和RMS)。
- 使用真实参考音频在训练期间进行端到端训练,推理时使用提取的特征,采用标准TTS损失训练GS-TC2模型。
- 使用WaveRNN声码器从生成的对数梅尔倒谱图中生成高保真波形。
- 提出两种新型客观指标:参考语音与合成语音的音高和RMS轮廓之间的余弦距离和动态时间规整(DTW)距离。
实验结果
研究问题
- RQ1一小撮全局韵律特征(音高和响度)是否能有效将韵律从参考音频迁移到合成语音中?
- RQ2与标准Tacotron2相比,使用全局统计量的韵律迁移在客观和主观评估中的性能如何?
- RQ3所提出的客观指标在多大程度上与人类对韵律迁移质量的感知相关?
- RQ4当参考语音来自不同说话人或非语音源时,该方法是否仍能泛化,前提是其韵律统计特性与目标说话人相似?
- RQ5使用紧凑的、非学习的参考编码器是否能避免更复杂潜在模型中常见的特征纠缠问题?
主要发现
- 与基线TC2相比,GS-TC2在参考语音与合成语音的音高轮廓之间实现了显著更低的余弦距离和DTW距离,音高余弦距离降低了45%(0.052 vs. 0.029)。
- RMS特征的迁移性能在GS-TC2与TC2之间相当,两者DTW距离相近(0.019),表明响度包络的迁移效果极强。
- 主观听音测试确认,使用GS-TC2生成的语音在自然度方面评分很高,并成功地从参考语音中迁移了韵律。
- 7维韵律特征的t-SNE可视化显示,在16组随机选择的案例中,GS-TC2生成的样本有14组更接近参考样本。
- 该方法以极低的计算开销实现了有效的韵律迁移,仅使用七个全局特征,避免了复杂学习编码器的使用。
- 初步实验表明,只要其韵律统计特性与目标说话人匹配,参考音频可以来自不同说话人,甚至非语音源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。