Skip to main content
QUICK REVIEW

[論文レビュー] SyntaSpeech: Syntax-Aware Generative Adversarial Text-to-Speech

Zhenhui Ye, Zhou Zhao|arXiv (Cornell University)|Apr 25, 2022
Speech Recognition and Synthesis被引用数 8
ひとこと要約

SyntaSpeechは、依存関係に基づくグラフエンコーダーを用いて木構造的な文法的情報を統合することで、プロソディーのモデリングを向上させる構文認識型で非自己回帰的な音声合成モデルを提案する。PortaSpeechのデュレーションおよびピッチ予測を構文特徴で強化し、フローベースのポストネットをマルチスケールの adversarial 学習に置き換えることで、英語、中国語、マルチスプーカーのデータセットにおいて、音声の自然さとプロソディーの表現力の両面で最先端の結果を達成した。

ABSTRACT

The recent progress in non-autoregressive text-to-speech (NAR-TTS) has made fast and high-quality speech synthesis possible. However, current NAR-TTS models usually use phoneme sequence as input and thus cannot understand the tree-structured syntactic information of the input sequence, which hurts the prosody modeling. To this end, we propose SyntaSpeech, a syntax-aware and light-weight NAR-TTS model, which integrates tree-structured syntactic information into the prosody modeling modules in PortaSpeech \cite{ren2021portaspeech}. Specifically, 1) We build a syntactic graph based on the dependency tree of the input sentence, then process the text encoding with a syntactic graph encoder to extract the syntactic information. 2) We incorporate the extracted syntactic encoding with PortaSpeech to improve the prosody prediction. 3) We introduce a multi-length discriminator to replace the flow-based post-net in PortaSpeech, which simplifies the training pipeline and improves the inference speed, while keeping the naturalness of the generated audio. Experiments on three datasets not only show that the tree-structured syntactic information grants SyntaSpeech the ability to synthesize better audio with expressive prosody, but also demonstrate the generalization ability of SyntaSpeech to adapt to multiple languages and multi-speaker text-to-speech. Ablation studies demonstrate the necessity of each component in SyntaSpeech. Source code and audio samples are available at https://syntaspeech.github.io

研究の動機と目的

  • 非自己回帰的TTSモデルが構文構造の認識を欠いていることによる、表現的なプロソディーのモデリングの限界を解消すること。
  • 依存解析を用いて木構造的な文法的情報を非自己回帰的TTSフレームワークのプロソディーモデリングパイプラインに統合すること。
  • フローベースのポストネットをマルチスケールの adversarial 学習に置き換えることで、トレーニングパイプラインを簡素化し、推論速度を向上させること。
  • テキストから音声に変換する合成において、複数の言語およびスプーカー条件での一般化を示すこと。

提案手法

  • 入力文の依存木から構文グラフを構築し、語をノード、文法的関係をエッジとして表現する。
  • グラフニューラルネットワーク(GCNベースのエンコーダー)を用いて、グラフからの構文特徴をアグリゲートし、語レベルの構文符号化を生成する。
  • PortaSpeechのデュレーション予測器および変分ジェネレータに、構文符号化を注入することで、プロソディー予測を向上させる。
  • PortaSpeechのフローベースのポストネットをマルチスケールの adversarial ディスクライマーに置き換えることで、音声のリアルさを向上させるとともに、推論速度を向上させる。
  • 複数の受容 field サイズで adversarial 損失を用いてトレーニングすることで、波形品質と一般化性能を向上させる。
  • 構文的文脈によって強化された、デュレーション、ピッチ、エネルギー予測の分離されたプロソディーモデリングを活用する。

実験結果

リサーチクエスチョン

  • RQ1木構造的な構文情報は、非自己回帰的TTSシステムにおけるプロソディーモデリングを改善できるか?
  • RQ2構文グラフ符号化を統合することで、合成音声の品質および表現力は向上するか?
  • RQ3フローベースのポストネットをマルチスケールの adversarial 学習に置き換えることで、音声品質が向上し、トレーニングが簡素化され、推論が高速化されるか?
  • RQ4提案手法は、異なる言語およびマルチスプーカー設定において一般化可能か?

主な発見

  • LJSpeechデータセットにおいて、SyntaSpeechは主観的品質評価で4.13 ± 0.08のMOSを達成し、FastSpeech2(3.94 ± 0.09)およびPortaSpeech(4.02 ± 0.08)を上回った。
  • 中国語のBiaobeiデータセットにおいて、SyntaSpeechは4.19 ± 0.07のMOSを達成し、非英語・トーン言語においても優れた性能を示した。
  • マルチスプーカーのLibriTTSベンチマークにおいて、SyntaSpeechは4.10 ± 0.08のMOSを達成し、スプーカーの変動に対しても堅牢であることを示した。
  • アブレーションスタディの結果、構文グラフエンコーダーを削除すると、CMOS-Pが最大0.188ポイント低下し、プロソディーモデリングにおけるその重要性が裏付けられた。
  • マルチスケールの adversarial 学習は、フローベースのポストネットと比較してLJSpeechでCMOS-Qを0.071ポイント向上させたが、プロソディー品質に顕著な低下は認めなかった。
  • 構文グラフを完全グラフに置き換えた場合、LJSpeechでCMOS-Pが0.160ポイント低下したため、構文的構造そのものが重要であり、単なるグラフの接続性だけではないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。