Skip to main content
QUICK REVIEW

[论文解读] GraphSpeech: Syntax-Aware Graph Attention Network For Neural Speech Synthesis

Rui Liu, Berrak Şişman|arXiv (Cornell University)|Oct 23, 2020
Natural Language Processing Techniques参考文献 31被引用 13
一句话总结

GraphSpeech 提出了一种语法感知的图注意力网络,用于神经文本到语音合成,通过图神经网络框架建模词语之间的句法依赖关系。通过将句法关系编码为图结构表示并将其整合到注意力机制中,GraphSpeech 在谱特征和韵律质量方面优于 Transformer TTS,MCD 为 6.821 dB,RMSE 为 1.625 Hz,在客观和主观评估中均优于基线模型。

ABSTRACT

Attention-based end-to-end text-to-speech synthesis (TTS) is superior to conventional statistical methods in many ways. Transformer-based TTS is one of such successful implementations. While Transformer TTS models the speech frame sequence well with a self-attention mechanism, it does not associate input text with output utterances from a syntactic point of view at sentence level. We propose a novel neural TTS model, denoted as GraphSpeech, that is formulated under graph neural network framework. GraphSpeech encodes explicitly the syntactic relation of input lexical tokens in a sentence, and incorporates such information to derive syntactically motivated character embeddings for TTS attention mechanism. Experiments show that GraphSpeech consistently outperforms the Transformer TTS baseline in terms of spectrum and prosody rendering of utterances.

研究动机与目标

  • 为解决 Transformer TTS 在建模句子级句法依赖关系方面的局限性,该局限性会影响韵律和谱特征的生成效果。
  • 通过将输入文本形式化为句法图,将语言学句法结构整合到神经 TTS 中。
  • 开发一种语法感知的图注意力机制,通过引入词元之间的句法关系来增强注意力机制。
  • 通过在谱特征和韵律建模中利用句法知识,提升语音合成质量。
  • 证明基于图的句法编码相比标准自注意力机制,能实现更自然、更准确的语音合成。

提出的方法

  • 该模型使用关系编码器从输入文本中提取依存解析树,并将其转换为带有表示句法关系的边嵌入的图结构。
  • 图编码器使用多头注意力机制处理图结构输入,不仅关注词元本身,还关注其句法关系,从而实现语法感知的上下文建模。
  • 图编码器以 256 维字符嵌入作为节点特征,采用 6 个块,每个块包含 4 个注意力头,以捕捉具有句法归纳偏置的长距离依赖关系。
  • 编码器-解码器架构生成 80 通道的梅尔频谱图特征,推理阶段使用 Griffin-Lim 进行波形重建。
  • 模型使用 Adam 优化器进行训练,学习率调度方式与 Transformer 相似,并对批量中所有不同的最短路径进行编码以提高计算效率。
  • 通过修改查询-键交互方式,将句法信息注入注意力机制,使其反映词元之间的语义和句法接近程度。

实验结果

研究问题

  • RQ1在句子中建模词语之间的句法依赖关系是否能提升神经文本到语音合成的质量?
  • RQ2通过图神经网络框架引入句法结构,如何影响 TTS 中的注意力机制?
  • RQ3与 Transformer TTS 中的标准自注意力机制相比,语法感知的图注意力机制是否能带来更优的谱特征和韵律表现?
  • RQ4GraphSpeech 在多大程度上达到或超越人类自然语音的水平?
  • RQ5基于图的句法编码是否能降低 MCD 和 RMSE 的声学特征重建误差?

主要发现

  • GraphSpeech 的梅尔频谱失真(MCD)为 6.821 dB,显著低于 Transformer TTS 基线的 8.021 dB,表明其谱特征保真度更优。
  • GraphSpeech 的韵律建模均方根误差(RMSE)为 1.625 Hz,而 Transformer TTS 基线为 1.782 Hz,表明其韵律准确性更高。
  • 在主观听音测试中,GraphSpeech 的平均意见得分(MOS)显著高于 Transformer TTS,且接近自然人类语音的水平。
  • AB 偏好测试显示,听众对 GraphSpeech 的偏好程度具有统计显著性(p 值约为 2.0×10⁻²⁰)。
  • 语法感知的图注意力机制能有效建模语言结构,从而生成更自然、韵律更优、谱特征更清晰的语音。
  • GraphSpeech 是首个在基于 Transformer 的 TTS 中采用图神经网络框架实现句法感知注意力机制的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。