[论文解读] Feature reinforcement with word embedding and parsing information in neural TTS
本文提出了一种神经文本到语音(TTS)中的特征增强方法,通过整合音素序列、预训练词嵌入以及句法解析信息作为多层次输入,以提升模型的泛化能力和鲁棒性。通过使用多输入编码器结合这些上下文敏感特征,系统在域外文本上实现了接近录音质量的语音输出,MOS得分提升至4.33,诊断测试中自然度指标最高提升9.09%。
In this paper, we propose a feature reinforcement method under the sequence-to-sequence neural text-to-speech (TTS) synthesis framework. The proposed method utilizes the multiple input encoder to take three levels of text information, i.e., phoneme sequence, pre-trained word embedding, and grammatical structure of sentences from parser as the input feature for the neural TTS system. The added word and sentence level information can be viewed as the feature based pre-training strategy, which clearly enhances the model generalization ability. The proposed method not only improves the system robustness significantly but also improves the synthesized speech to near recording quality in our experiments for out-of-domain text.
研究动机与目标
- 为解决神经TTS系统在处理域外文本时泛化能力差的挑战。
- 提升对未见或领域不匹配文本输入的语音自然度与可懂度。
- 探究预训练语言特征(词嵌入与句法解析)是否可作为基于特征的预训练方式以提升模型性能。
- 评估词级与句级语言信息在提升TTS鲁棒性与质量方面的互补作用。
提出的方法
- 该方法采用多输入编码器,处理三种层次的输入:音素序列、预训练词嵌入以及来自Stanford Parser的句法解析树。
- 词嵌入源自大规模文本上预训练的神经机器翻译(NMT)模型,捕捉语义与上下文信息。
- 句法结构通过Stanford Parser提取,提供词性角色与短语边界信息。
- 编码器通过独立的子网络处理这些输入,随后共享统一的注意力机制,并与WaveNet声码器配合使用。
- 模型采用端到端的序列到序列框架进行训练,利用注意力机制对齐文本与梅尔频谱图输出。
- 该方法在Tacotron2的重新实现设置下进行评估,使用音素级输入而非字符级输入。
实验结果
研究问题
- RQ1整合词嵌入与句法解析信息是否能提升神经TTS在域外文本上的性能?
- RQ2词级与句级特征在提升语音自然度与可懂度方面有何差异?
- RQ3这些特征在多大程度上可作为基于特征的预训练方式以提升模型泛化能力?
- RQ4词嵌入与句法信息是否对语调与发音准确性具有互补效应?
主要发现
- 所提方法在域外文本上的MOS得分为4.33,显著优于基线模型(4.17),并接近录音质量(4.44)。
- 在诊断可懂度测试中,同时加入词嵌入与句法信息使自然度率绝对提升9.09%,达到95.45%。
- 仅使用句法信息时,可懂率提升7.46%,自然率提升8.77%,优于仅使用词嵌入的情况。
- 词嵌入与句法信息的结合取得最高性能,表明其在语调与发音方面具有互补优势。
- 当同时使用两种特征时,评审者报告合成语音中的停顿更自然,语调表现更优。
- 结果证实,来自大规模NLP模型的预训练语言特征可有效提升神经TTS在未见领域中的鲁棒性与语音质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。