[论文解读] PnG BERT: Augmented BERT on Phonemes and Graphemes for Neural TTS
该论文提出 PnG BERT,一种基于自监督预训练的 BERT 模型编码器,通过联合处理文本的音素和字素表示,并结合词级对齐,以提升神经文本到语音(TTS)合成效果。通过在大规模文本语料上进行预训练,该模型显著提升了语调表现和发音准确性,在主观评价中达到人类水平的自然度,且合成语音与专业录音之间无显著偏好差异。
This paper introduces PnG BERT, a new encoder model for neural TTS. This model is augmented from the original BERT model, by taking both phoneme and grapheme representations of text as input, as well as the word-level alignment between them. It can be pre-trained on a large text corpus in a self-supervised manner, and fine-tuned in a TTS task. Experimental results show that a neural TTS model using a pre-trained PnG BERT as its encoder yields more natural prosody and more accurate pronunciation than a baseline model using only phoneme input with no pre-training. Subjective side-by-side preference evaluations show that raters have no statistically significant preference between the speech synthesized using a PnG BERT and ground truth recordings from professional speakers.
研究动机与目标
- 为解决仅使用音素或仅使用字素的编码器在神经 TTS 中处理语调和发音歧义方面的局限性。
- 通过在词级对齐下联合建模音素与字素表示,提升 TTS 中的自然语言理解能力。
- 实现通过大规模文本语料上的自监督掩码语言建模,对统一编码器进行有效预训练。
- 证明预训练的 PnG BERT 编码器可显著提升神经 TTS 系统中语音的自然度与发音准确性。
- 通过与专业录音的对比测试,实现接近人类水平的语音质量。
提出的方法
- PnG BERT 扩展了 BERT 模型,接收两个输入序列:一组国际音标(IPA)音素和一组子词单元(字素),两者共享同一嵌入空间。
- 引入一种基于正弦函数的词位置嵌入,显式建模音素与字素之间的词级对齐。
- 采用大规模文本语料上的掩码语言建模(MLM)目标进行预训练,并提出一种新颖的词级一致掩码策略,以在预训练过程中保持音素-字素对齐。
- 在预训练过程中,模型基于上下文预测被掩码的音素和字素,且两种模态共享嵌入表示。
- 预训练的 PnG BERT 编码器在神经 TTS 管道中进行端到端微调,兼容基于注意力机制和基于时长预测的 TTS 架构。
- 模型采用共享的 token ID 空间表示音素与字素,实现联合表征学习,同时保持与标准 BERT 架构的兼容性。
实验结果
研究问题
- RQ1通过词级对齐联合建模音素与字素表示,能否改善神经 TTS 中的语调与发音?
- RQ2在大规模文本语料上,使用双模态 BERT 架构进行自监督预训练,是否能提升合成语音的泛化能力与自然度?
- RQ3与仅使用音素或字素输入的模型相比,PnG BERT 在多大程度上减少了发音错误?
- RQ4基于 PnG BERT 的 TTS 系统能否实现与专业人类录音相当的感知质量?
- RQ5在预训练过程中引入词级对齐,相较于随机或不一致的掩码策略,对模型性能有何影响?
主要发现
- 在神经 TTS 模型中使用预训练的 PnG BERT 显著提升了语音自然度,平均意见评分(MOS)达到 4.47 ± 0.05,与专业录音性能相当。
- 主观对比偏好测试显示,使用 PnG BERT 合成的语音与专业配音员的真实录音之间无统计学上显著差异。
- 消融实验表明,预训练和词级对齐至关重要:未进行预训练的模型在长输入上表现劣于基线,表明泛化能力差。
- 表现最佳的 PnG BERT 变体采用了词级一致掩码策略,在预训练期间实现了最高的 G2P 和 P2G 准确率,且与 TTS 性能提升呈正相关。
- 模型在语调与发音方面优于基线,评分者评论证实其在重音、语调控制方面表现更优,且不自然失真更少。
- 出人意料的是,预训练期间 G2P/P2G 准确率最高的模型并未带来最佳的 TTS 表现,表明其主要优势在于提升语言理解能力,而非 G2P 转换准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。