Skip to main content
QUICK REVIEW

[論文レビュー] Robust universal neural vocoding

Jaime Lorenzo-Trueba, Thomas Drugman|arXiv (Cornell University)|Nov 15, 2018
Speech Recognition and Synthesis参考文献 6被引用数 10
ひとこと要約

本論文では、17の言語で74人の話者を対象にトレーニングされた、耐障害性に優れたユニバーサルニューラルボコーダーを提示している。ドメイン内およびドメイン外の状態において、平均MUSHRAスコアの相対値が98%に達している。再帰型ニューラルネットワーク(RNN)ベースのアーキテクチャが、畳み込みニューラルネットワーク(CNN)と比較して、特に未知の話者、スタイル、録音条件において顕著に高い安定性と普遍的な耐障害性を示すことが示された。

ABSTRACT

This paper introduces a robust universal neural vocoder trained with 74 speakers (comprised of both genders) coming from 17 languages. This vocoder is shown to be capable of generating speech of consistently good quality (98% relative mean MUSHRA when compared to natural speech) regardless of whether the input spectrogram comes from a speaker, style or recording condition seen during training or from an out-of-domain scenario. Together with the system, we present a full text-to-speech analysis of robustness of a number of implemented systems. The complexity of systems tested range from a convolutional neural networks-based system conditioned on linguistics to a recurrent neural networks-based system conditioned on mel-spectrograms. The analysis shows that convolutional neural networks-based systems are prone to occasional instabilities, while the recurrent approaches are significantly more stable and capable of providing universalizing robustness.

研究の動機と目的

  • 多様な話者、言語、録音条件にわたって普遍的に一般化できる耐障害性の高いユニバーサルニューラルボコーダーの開発。
  • ドメイン内およびドメイン外のシナリオにおける、CNNおよびRNNベースのシステムを含むさまざまなニューラルボコーダーのアーキテクチャの耐障害性の評価。
  • 実世界のTTSアプリケーションにおけるニューラルボコーダーの安定性と一般化性能を向上させるアーキテクチャ選択の特定。
  • ニューラルボコーディングにおけるシステムの複雑さと耐障害性の関係を包括的に分析すること。

提案手法

  • 17の言語にまたがり、両性別および多様な話し方のスタイルを含む74人の話者からなる多様なデータセットを用いてニューラルボコーダーをトレーニングする。
  • ボコーダーの入力特徴としてメルスペクトログラムを用い、言語的および音声的特徴に条件づけられたモデルを構築する。
  • 比較のため、畳み込みニューラルネットワーク(CNN)および再帰型ニューラルネットワーク(RNN)の両方のアーキテクチャを実装する。
  • 自然音声との比較による聴取的品質を測定するため、MUSHRAスコアを用いてモデルのパフォーマンスを評価する。
  • 未知の話者、スタイル、録音条件を含むドメイン外の入力に対する一般化性能をテストする。
  • 体系的なアブレーションとクロス条件評価を通じて、システムの安定性と耐障害性を分析する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルボコーダーのパフォーマンスは、ドメイン内およびドメイン外の話者、スタイル、録音条件においてどのように変化するか?
  • RQ2CNNとRNNのどちらのニューラルアーキテクチャが、ユニバーサルニューラルボコーディングにおいてより高い安定性と耐障害性を示すか?
  • RQ31つのボコーダーが、多様な言語および話者の特徴にわたってどの程度一般化できるか?
  • RQ4モデルの複雑さは、ニューラルボコーディングにおける聴取的品質と一般化性能にどのような影響を与えるか?

主な発見

  • 提案されたユニバーサルボコーダーは、自然音声との比較において、平均MUSHRAスコアの相対値が98%に達しており、多様な条件下でも高い聴取的品質を示している。
  • RNNベースのボコーダーは、特にドメイン外のシナリオにおいて、CNNベースの対比モデルと比較して顕著に高い安定性と耐障害性を示している。
  • CNNベースのシステムは、未知の話者またはスタイルの変化に直面した際に、時折不安定な挙動を示す。
  • システムは17の言語および男性・女性の両方の話者において一貫したパフォーマンスを維持しており、強力な一般化性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。