Skip to main content
QUICK REVIEW

[论文解读] Probing the phonetic and phonological knowledge of tones in Mandarin TTS models

Jian Zhu|arXiv (Cornell University)|Dec 23, 2019
Speech Recognition and Synthesis参考文献 26被引用 5
一句话总结

本研究通过受控刺激,探究了中文文本转语音(TTS)模型——特别是Tacotron 2及其引入BERT嵌入的版本——在音位和音系知识方面的表现,聚焦于声调协同发音与第三声变调规则。结果表明,两种模型均能准确再现表层声调协同发音现象,但在处理新颖、复杂的句子时,未能一致地应用第三声变调的规则性法则;引入BERT增强的模型在泛化能力上略有提升,但整体准确率仍较低。

ABSTRACT

This study probes the phonetic and phonological knowledge of lexical tones in TTS models through two experiments. Controlled stimuli for testing tonal coarticulation and tone sandhi in Mandarin were fed into Tacotron 2 and WaveGlow to generate speech samples, which were subject to acoustic analysis and human evaluation. Results show that both baseline Tacotron 2 and Tacotron 2 with BERT embeddings capture the surface tonal coarticulation patterns well but fail to consistently apply the Tone-3 sandhi rule to novel sentences. Incorporating pre-trained BERT embeddings into Tacotron 2 improves the naturalness and prosody performance, and yields better generalization of Tone-3 sandhi rules to novel complex sentences, although the overall accuracy for Tone-3 sandhi was still low. Given that TTS models do capture some linguistic phenomena, it is argued that they can be used to generate and validate certain linguistic hypotheses. On the other hand, it is also suggested that linguistically informed stimuli should be included in the training and the evaluation of TTS models.

研究动机与目标

  • 评估端到端TTS模型在多音节词声调方面所掌握的语音学与音系学知识的程度。
  • 探究TTS模型是否能在未见的复杂句式中,无需显式监督,泛化声调规则(尤其是规则性的第三声变调)。
  • 评估通过BERT嵌入引入句法信息是否能提升模型在应用音系规则方面的准确性。
  • 确定TTS模型是否可作为计算工具,用于生成并验证语音学与音系学中的语言学假说。
  • 强调在训练与评估TTS模型时,设计语言学导向刺激的重要性,以提升其语言学保真度。

提出的方法

  • 为两个实验构建了受控刺激:使用[ma, mo, mi]在6种载句中组合成576组双音节搭配,用于声调协同发音测试。
  • 设计了第三声变调的刺激,以检验在双音节与三音节词中的泛化能力,包括依赖于短语边界判断的复杂句法结构。
  • 将文本输入Tacotron 2与引入BERT嵌入的Tacotron 2,生成梅尔频谱图,再通过WaveGlow转换为原始波形。
  • 对生成的语音样本进行声学分析与人工评估,以判断声调准确度与语调表现。
  • 采用混合逻辑回归模型比较两种TTS模型在第三声变调任务中的表现,并对模型差异进行显著性检验。
  • 错误分析聚焦于错误是否源于对变调规则的错误应用,或在句法边界处的误用,尤其在长句中。

实验结果

研究问题

  • RQ1TTS模型在多大程度上能再现人类语音中观察到的表层声调协同发音模式?
  • RQ2TTS模型能否在无显式监督的情况下,将第三声变调规则泛化到新颖、复杂的句法结构中?
  • RQ3通过BERT嵌入引入句法信息,是否能提升模型在未见刺激中应用第三声变调的准确性?
  • RQ4第三声变调应用中的错误,是由于句法结构解析失败,还是规则应用错误所致?
  • RQ5TTS模型能否作为有效工具,用于生成并测试语音学与音系学中的语言学假说?

主要发现

  • Tacotron 2与引入BERT嵌入的Tacotron 2均能准确再现表层声调协同发音模式,与人类生成数据高度一致。
  • 基线Tacotron 2在复杂第三声变调刺激中每句平均产生1.31个声调错误,而BERT增强版本将该数值降低至每句0.92个错误。
  • BERT增强模型在将第三声变调泛化至复杂句子方面表现出统计显著的改进(β = -0.52,p = 0.01),但整体准确率仍较低。
  • 两种模型在单独的双音节与三音节组合中均一致地应用第三声变调规则,但在长句的正确句法边界处频繁出错。
  • 错误分析显示,大多数错误源于对句法结构的错误解析,而非规则应用失败,表明其在结构理解方面存在局限。
  • 尽管语音自然度与语调质量较高,TTS模型仍未完全掌握第三声变调的规则性、基于规则的本质,提示其对底层音系规则的掌握尚不完整。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。