Skip to main content
QUICK REVIEW

[論文レビュー] GraphSpeech: Syntax-Aware Graph Attention Network For Neural Speech Synthesis

Rui Liu, Berrak Şişman|arXiv (Cornell University)|Oct 23, 2020
Natural Language Processing Techniques参考文献 31被引用数 13
ひとこと要約

GraphSpeechは、構文的依存関係をグラフニューラルネットワークフレームワークを用いてモデル化する構文に配慮したグラフアテンションネットワークを提案する。構文的関係をグラフ構造表現に統合し、アテンション機構に組み込むことで、Transformer TTSに比べて優れたスペクトル品質およびプロソディック品質を達成し、MCD 6.821 dB、RMSE 1.625 Hzを達成。客観的および主観的評価の両方でベースラインを上回った。

ABSTRACT

Attention-based end-to-end text-to-speech synthesis (TTS) is superior to conventional statistical methods in many ways. Transformer-based TTS is one of such successful implementations. While Transformer TTS models the speech frame sequence well with a self-attention mechanism, it does not associate input text with output utterances from a syntactic point of view at sentence level. We propose a novel neural TTS model, denoted as GraphSpeech, that is formulated under graph neural network framework. GraphSpeech encodes explicitly the syntactic relation of input lexical tokens in a sentence, and incorporates such information to derive syntactically motivated character embeddings for TTS attention mechanism. Experiments show that GraphSpeech consistently outperforms the Transformer TTS baseline in terms of spectrum and prosody rendering of utterances.

研究の動機と目的

  • Transformer TTSが文レベルの構文的依存関係をモデル化できないという限界を解決すること。これは、プロソディーおよびスペクトルレンダリングに影響を与える。
  • 入力テキストを構文的グラフとして定式化することで、言語的構文的構造を神経的TTSに統合すること。
  • トークン間の構文的関係を組み込むことで、アテンションを強化する構文に配慮したグラフアテンション機構を開発すること。
  • スペクトルおよびプロソディーのモデリングにおいて、構文的知識を活用することで音声合成品質を向上させること。
  • グラフベースの構文的符号化が、標準的な自己アテンションに比べてより自然で正確な音声合成をもたらすかどうかを実証すること。

提案手法

  • モデルは、入力テキストから依存解析ツリーを抽出し、構文的関係を表すエッジ埋め込みを有するグラフ構造に変換するための関係エンコーダーを使用する。
  • グラフエンコーダーは、トークンだけでなくその構文的関係に対しても注目する多ヘッドアテンションを用いて、グラフ構造入力を処理し、構文に配慮したコンテキストモデリングを可能にする。
  • エンコーダーはノード特徴として256次元の文字埋め込みを入力とし、1ブロックあたり4ヘッドのアテンションを用いた6ブロックを適用することで、構文的インダクティブバイアスを有する長距離依存関係を捉える。
  • エンコーダ-デコーダー構造により80チャネルのメルスペクトログラム特徴量を生成し、推論時にはGriffin-Limを用いて波形を再構築する。
  • Adam最適化アルゴリズムを用いて学習を実行し、Transformerと同様の学習率スケジュールを採用する。バッチ内のすべての異なる最短経路を計算効率を高めるために符号化する。
  • 構文的情報は、クエリ-キー相互作用を変更することでアテンション機構に統合され、トークン間の意味的および構文的近接性を反映する。

実験結果

リサーチクエスチョン

  • RQ1文内の単語間の構文的依存関係をモデル化することで、神経的テキスト音声合成の品質が向上するか?
  • RQ2グラフニューラルネットワークフレームワークを用いて構文的構造を統合することで、TTSにおけるアテンション機構にどのような影響を与えるか?
  • RQ3構文に配慮したグラフアテンション機構は、Transformer TTSにおける標準的な自己アテンションに比べ、より優れたスペクトルおよびプロソディックレンダリングを実現するか?
  • RQ4GraphSpeechは、人間の自然な発話水準にどれほど近いか、あるいはそれを上回るか?
  • RQ5グラフベースの構文的符号化は、音声特徴再構築におけるMCDおよびRMSEを低減できるか?

主な発見

  • GraphSpeechはメルスペクトル歪み(MCD)が6.821 dBに低下し、ベースラインのTransformer TTS(8.021 dB)よりも顕著に低い値を示しており、優れたスペクトル忠実度を示している。
  • プロソディーモデリングにおける平均二乗誤差(RMSE)は、GraphSpeechで1.625 Hz、Transformer TTSベースラインで1.782 Hzであり、より高いプロソディック正確性を示している。
  • 主観的聴取テストでは、GraphSpeechの平均意見スコア(MOS)はTransformer TTSを有意に上回り、自然な人間発話に近い水準であった。
  • AB好みテストでは、p値約2.0×10⁻²⁰の有意差が得られ、聴取者によるGraphSpeechの好まれ方が強く統計的に有意であった。
  • 構文に配慮したグラフアテンション機構は、言語的構造を効果的にモデル化し、より自然な響きの音声、改善されたプロソディーおよびスペクトル品質を実現した。
  • GraphSpeechは、TransformerベースTTSにおける構文的インフォームドアテンション機構をグラフニューラルネットワークフレームワークで実装した初の試みである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。