Skip to main content
QUICK REVIEW

[论文解读] An Investigation of the Relation Between Grapheme Embeddings and Pronunciation for Tacotron-based Systems

Antoine Perquin, Erica Cooper|arXiv (Cornell University)|Oct 21, 2020
Natural Language Processing Techniques参考文献 16被引用 4
一句话总结

本文研究了在法语字母音素上训练的Tacotron模型如何在其嵌入中学习到类似音素的表征,表明尽管训练过程中没有语音监督,这些字母音素嵌入仍隐式编码了发音信息。关键发现是,这些嵌入可用于字母音素转换(G2P)和合成语音中的语音控制,即使在仅使用字母音素的系统中也能实现音素层面的操控。

ABSTRACT

End-to-end models, particularly Tacotron-based ones, are currently a popular solution for text-to-speech synthesis. They allow the production of high-quality synthesized speech with little to no text preprocessing. Indeed, they can be trained using either graphemes or phonemes as input directly. However, in the case of grapheme inputs, little is known concerning the relation between the underlying representations learned by the model and word pronunciations. This work investigates this relation in the case of a Tacotron model trained on French graphemes. Our analysis shows that grapheme embeddings are related to phoneme information despite no such information being present during training. Thanks to this property, we show that grapheme embeddings learned by Tacotron models can be useful for tasks such as grapheme-to-phoneme conversion and control of the pronunciation in synthetic speech.

研究动机与目标

  • 探究在无显式语音监督的情况下,基于字母音素训练的Tacotron模型是否能学习到与音素相关的表征。
  • 评估基于字母音素的嵌入在低资源场景下进行字母到音素(G2P)转换的实用性。
  • 探索通过嵌入操控在基于字母音素的TTS系统中实现语音控制的可行性。
  • 在高质量法语数据集上,比较基于字母音素与基于音素的Tacotron模型的性能。
  • 评估拼写一致性对所学嵌入表征的语音相关性的影响。

提出的方法

  • 使用经过筛选的法语数据集,基于一个使用独热编码字母音素作为输入的Tacotron模型进行训练,采用CBHG模块和自注意力模块以增强序列建模能力。
  • 从CBHG模块的输出中提取嵌入,该模块处理可变长度的字母音素序列,并充当类似N-gram的模式滤波器。
  • 训练一个浅层LSTM模型,使用CTC损失从提取的字母音素嵌入中预测音素,实现端到端音素预测,无需对齐数据。
  • 通过测试集上的音素错误率(PER)来衡量使用嵌入与原始字母音素进行G2P转换的性能。
  • 通过在不同句子之间交换上下文相关的字母音素嵌入,开展概念验证实验,以控制合成语音中的发音。
  • 使用WaveRNN声码器从Tacotron模型预测的梅尔频谱图生成语音。

实验结果

研究问题

  • RQ1在无语音监督训练的Tacotron模型中,字母音素嵌入是否包含有意义的语音信息?
  • RQ2字母音素嵌入是否可有效用于字母到音素转换,特别是在低资源场景下?
  • RQ3是否可以通过操控学习到的嵌入,在基于字母音素的TTS系统中实现语音控制?
  • RQ4在高质量法语数据集上,基于字母音素的Tacotron模型与基于音素的Tacotron模型相比,性能如何?
  • RQ5拼写一致性如何影响所学字母音素嵌入的语音相关性?

主要发现

  • 在经过精心筛选的法语数据集上,基于字母音素的Tacotron模型在发音准确性和整体语音质量方面与基于音素的模型表现相当。
  • 当使用嵌入进行G2P转换时,该Tacotron模型在训练集上实现了12.8%的平均音素错误率(PER),优于直接在原始字母音素上训练的模型(19.3% PER)。
  • 在较小的开发集(400个句子)上,使用嵌入的G2P模型仍优于原始字母音素模型(16.4% vs. 30.2% PER),表明嵌入对数据稀缺更具鲁棒性。
  • 通过在相似语境中交换字母音素'b'和'm'的嵌入,成功实现了语音控制,合成语音正确输出了/m/而非/b/。
  • 当上下文差异较大时,听者无法可靠识别目标音素,表明基于嵌入的控制具有上下文依赖性。
  • 结果表明,Tacotron的CBHG模块隐式学习到了类似于基于N-gram的G2P规则的统计模式,从而仅从字母音素中就能实现语音表征的学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。