[论文解读] Building a mixed-lingual neural TTS system with only monolingual data
本文提出一种仅使用目标说话人单语数据的中英混合语言神经文本转语音(TTS)系统。该系统通过在解码器中引入说话人嵌入与平均语音模型,并结合音素感知注意力机制,实现了说话人一致性与自然性。结果表明,通过合理建模语音与说话人表征,仅使用单语数据即可实现高质量的混合语言合成。
When deploying a Chinese neural text-to-speech (TTS) synthesis system, one of the challenges is to synthesize Chinese utterances with English phrases or words embedded. This paper looks into the problem in the encoder-decoder framework when only monolingual data from a target speaker is available. Specifically, we view the problem from two aspects: speaker consistency within an utterance and naturalness. We start the investigation with an Average Voice Model which is built from multi-speaker monolingual data, i.e. Mandarin and English data. On the basis of that, we look into speaker embedding for speaker consistency within an utterance and phoneme embedding for naturalness and intelligibility and study the choice of data for model training. We report the findings and discuss the challenges to build a mixed-lingual TTS system with only monolingual data.
研究动机与目标
- 探究是否可以仅使用单一目标说话人的单语数据构建混合语言TTS系统。
- 评估说话人嵌入在语言切换过程中维持说话人一致性的有效性。
- 检验音素嵌入是否能提升代码切换语音的自然度与可懂度。
- 确定单语训练数据是否足以实现高质量的混合语言合成,还是必须依赖混合语言数据。
- 分析模型架构选择(如说话人嵌入位置与注意力机制)对合成质量的影响。
提出的方法
- 在多说话人单语数据(中文与英文)上训练平均语音模型(AVM),以建立共享的声学空间。
- 将说话人嵌入整合至解码器输入(SE-DEC),以更好地控制说话人身份,并在语言切换时提升一致性。
- 通过附加上下文向量(PECV)与残差编码器(RES)实现音素感知注意力机制,以增强对齐与上下文表征。
- 在三种数据配置下进行训练:单语中文(CORPUS-MAN)、单语英文(CORPUS-ENG)以及目标说话人的混合语言(CORPUS-MIX)语句。
- 通过听音测试比较AB偏好,评估自然度与说话人一致性在三种语言中的表现。
- 将SE-DEC与微调AVM(Retrain-AVM)进行对比,并分析训练数据构成对模型泛化能力的影响。
实验结果
研究问题
- RQ1当仅在单语数据上进行训练时,编码器是否能学习到对中文与英文音素具有意义且区别的语音表征?
- RQ2说话人嵌入在编码器与解码器中的位置差异,如何影响混合语言语句中的说话人一致性?
- RQ3音素嵌入是否能改善注意力对齐,并提升代码切换语音的自然度与可懂度?
- RQ4单语数据是否足以训练出鲁棒的混合语言TTS系统,还是必须依赖混合语言数据才能实现最佳性能?
- RQ5训练数据选择(仅中文、仅英文或混合)如何影响模型在跨语言场景下的泛化能力?
主要发现
- 在多说话人单语数据上训练的平均语音模型能够学习到有意义的语音表征,并在无双语数据的情况下区分中文与英文音素。
- 将说话人嵌入集成至解码器输入(SE-DEC)在语言切换过程中维持说话人一致性方面优于基于编码器的集成方式。
- 混合语言训练数据(CORPUS-MIX)在混合语言合成中优于单语数据,尽管单语数据仍可产生可接受的结果。
- 残差编码器(SE-DEC-RES)在所有三种语言中均比附加上下文向量(SE-DEC-PECV)表现出更优的自然度,且说话人一致性相当。
- 听音测试表明,仅使用中文数据训练的模型在单语中文合成中更受青睐;当无英文数据时,中文数据在单语英文合成中也优于混合语言数据。
- 音素感知注意力显著提升了代码切换语句的自然度与说话人一致性,尤其有效减少了相邻英文单词周围中文词语的声调错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。