Skip to main content
QUICK REVIEW

[論文レビュー] Feature reinforcement with word embedding and parsing information in neural TTS

Huaiping Ming, Lei He|arXiv (Cornell University)|Jan 3, 2019
Speech Recognition and Synthesis参考文献 19被引用数 13
ひとこと要約

本稿では、音素列、事前学習済み単語埋め込み、句構造解析情報という複数レベルの入力を統合することで、ニューラルTTSにおける特徴強化手法を提案する。これにより、モデルの汎化性能とロバスト性が向上し、ドメイン外のテキストに対しても記録品質に近い音声が得られる。MOSは4.33に上昇し、診断テストでは自然さの指標が最大9.09%向上した。

ABSTRACT

In this paper, we propose a feature reinforcement method under the sequence-to-sequence neural text-to-speech (TTS) synthesis framework. The proposed method utilizes the multiple input encoder to take three levels of text information, i.e., phoneme sequence, pre-trained word embedding, and grammatical structure of sentences from parser as the input feature for the neural TTS system. The added word and sentence level information can be viewed as the feature based pre-training strategy, which clearly enhances the model generalization ability. The proposed method not only improves the system robustness significantly but also improves the synthesized speech to near recording quality in our experiments for out-of-domain text.

研究の動機と目的

  • ドメイン外テキストを処理する際のニューラルTTSシステムにおける一般化性能の低さという課題に対処すること。
  • 未知またはドメイン不一致のテキスト入力に対し、音声の自然さと聞き取りやすさを向上させること。
  • 事前学習済み言語的特徴(単語埋め込みと解析)が、モデル性能を向上させるための特徴ベースの事前学習の形として機能するかどうかを検討すること。
  • 単語レベルと文レベルの言語的情報が、TTSのロバスト性と品質を向上させる上でどのように補完的役割を果たすかを評価すること。

提案手法

  • 本手法は、音素列、事前学習済み単語埋め込み、Stanford Parserによる構文解析木という3段階の入力を処理するマルチインプットエンコーダーを採用する。
  • 単語埋め込みは、大規模テキスト上で事前学習されたNMTモデルから得られ、意味的および文脈的情報を捉えている。
  • 構文構造はStanford Parserを用いて抽出され、品詞の役割やフレーズ境界の情報を提供する。
  • エンコーダーは、これらの入力を個別のサブネットワークで処理した後、統一されたアテンションメカニズムとWaveNetボコーダーを備えたデコーダーに統合する。
  • モデルは、テキストとメルスペクトログラム出力のアライメントにアテンションを用いる、エンドツーエンドのシーケンス・トゥ・シーケンスフレームワークで訓練される。
  • 本手法は、文字レベルの入力ではなく、音素レベルの入力が使用されたTacotron2の再実装を基盤として評価される。

実験結果

リサーチクエスチョン

  • RQ1単語埋め込みと構文解析情報の統合が、ドメイン外テキストにおけるニューラルTTSの性能向上に寄与するか?
  • RQ2単語レベルと文レベルの特徴は、音声の自然さと聞き取りやすさの向上において、どのように比較されるか?
  • RQ3これらの特徴が、モデルの一般化を向上させるために、どの程度特徴ベースの事前学習の役割を果たすか?
  • RQ4単語埋め込みと解析情報は、プロソディーと発音の正確性の向上において、補完的効果を示すか?

主な発見

  • 提案手法は、ドメイン外テキストにおいてMOSが4.33を達成し、ベースライン(4.17)を著しく上回り、記録品質(4.44)に近づいた。
  • 単語埋め込みと解析情報の両方を追加することで、診断用の聞き取りやすさテストで自然さの指標が9.09%(絶対値)向上し、95.45%に達した。
  • 解析情報のみを用いた場合、聞き取りやすさの指標が7.46%、自然さの指標が8.77%(両方とも絶対値)向上し、単語埋め込みのみを用いる場合を上回った。
  • 単語埋め込みと解析情報の組み合わせが最も高い性能を示し、プロソディーと発音の両面で補完的利点があることが示された。
  • 両方の特徴を組み合わせた場合、審査員は合成音声の自然な間の長さと改善されたプロソディーを報告した。
  • 結果から、大規模NLPモデルから得た事前学習済み言語的特徴が、未知のドメインにおけるニューラルTTSのロバスト性と品質を効果的に向上させられると確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。