[论文解读] Variation and Synthetic Speech
本文提出一种基于神经网络的方法,利用跨方言发音词典和可训练的后词素模块,对合成语音中的语言变体进行建模。通过在微调过程中学习每个说话人的特定发音变体,该系统在无需为每位说话人进行大量手工音素标注的情况下,提升了合成语音的自然度。
We describe the approach to linguistic variation taken by the Motorola speech synthesizer. A pan-dialectal pronunciation dictionary is described, which serves as the training data for a neural network based letter-to-sound converter. Subsequent to dictionary retrieval or letter-to-sound generation, pronunciations are submitted a neural network based postlexical module. The postlexical module has been trained on aligned dictionary pronunciations and hand-labeled narrow phonetic transcriptions. This architecture permits the learning of individual postlexical variation, and can be retrained for each speaker whose voice is being modeled for synthesis. Learning variation in this way can result in greater naturalness for the synthetic speech that is produced by the system.
研究动机与目标
- 解决生成反映地域和个体发音差异的自然语音合成的挑战。
- 开发一种可扩展、可训练的系统,捕捉后词素音位变体,而无需为每位说话人提供完整的音素转写。
- 通过在个体说话人数据上微调后词素神经网络,实现对合成语音的说话人特定自适应。
- 在保留音位准确性和合成自然度的前提下,将方言多样性整合到单一发音词典中。
提出的方法
- 构建一个跨方言发音词典,作为音素转写(L2S)神经网络的训练数据。
- L2S模型从文本输入生成初始发音,随后传递给后词素神经网络。
- 后词素模块通过对齐的词典发音和手工标注的窄音位转写进行训练,以建模说话人特定的音位变体。
- 针对每个目标说话人,使用其语音数据对后词素网络进行微调,实现个性化发音建模。
- 该系统利用神经网络学习输入文本与输出音位序列之间复杂的非线性映射,同时保留说话人特定特征。
- 该架构支持跨方言和个体的变体模式端到端学习,从而提升合成语音的自然度。
实验结果
研究问题
- RQ1如何使单一语音合成系统有效建模多种方言的发音变体?
- RQ2可训练的后词素模块在捕捉个体说话人特定音位变体方面发挥什么作用?
- RQ3神经网络能否在无需为每位说话人提供完整音素标注的情况下,有效学习并应用后词素发音规则?
- RQ4为何针对每位说话人微调后词素模块能提升合成语音的自然度?
主要发现
- 该系统成功利用单一统一的发音词典,在多种方言间有效建模语言变体。
- 通过在个体语音数据上微调,后词素神经网络能有效学习说话人特定的发音模式。
- 使用神经网络进行后词素处理,使系统能够以高精度在方言和个体变体之间进行泛化。
- 针对每位说话人微调后词素模块,相比固定规则系统,显著提升了合成语音的自然度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。