Skip to main content
QUICK REVIEW

[論文レビュー] Cross-lingual Multi-speaker Text-to-speech Synthesis for Voice Cloning without Using Parallel Corpus for Unseen Speakers

Zhaoyu Liu, Brian Mak|arXiv (Cornell University)|Nov 26, 2019
Speech Recognition and Synthesis参考文献 24被引用数 19
ひとこと要約

本稿では、並列データを必要とせず、英語および中国語の既知および未知の母語話者および外国語話者に対して高品質なボイスクラーニングを可能にするクロスリンガルマルチスプーカーTTSシステムを提案する。xベクトルスプーカー埋め込み、言語埋め込み、トーン/ストレス埋め込みに条件づけ、スプーカー埋め込みのL2正規化またはホワイトニングを適用することで、広く言語を跨ぐ性能を示す広東語で学習されたWaveNet音声合成器を用いて、未学習スプーカーに対しても自然で高品質な音声を生成する。

ABSTRACT

We investigate a novel cross-lingual multi-speaker text-to-speech synthesis approach for generating high-quality native or accented speech for native/foreign seen/unseen speakers in English and Mandarin. The system consists of three separately trained components: an x-vector speaker encoder, a Tacotron-based synthesizer and a WaveNet vocoder. It is conditioned on 3 kinds of embeddings: (1) speaker embedding so that the system can be trained with speech from many speakers will little data from each speaker; (2) language embedding with shared phoneme inputs; (3) stress and tone embedding which improves naturalness of synthesized speech, especially for a tonal language like Mandarin. By adjusting the various embeddings, MOS results show that our method can generate high-quality natural and intelligible native speech for native/foreign seen/unseen speakers. Intelligibility and naturalness of accented speech is low as expected. Speaker similarity is good for native speech from native speakers. Interestingly, speaker similarity is also good for accented speech from foreign speakers. We also find that normalizing speaker embedding x-vectors by L2-norm normalization or whitening improves output quality a lot in many cases, and the WaveNet performance seems to be language-independent: our WaveNet is trained with Cantonese speech and can be used to generate Mandarin and English speech very well.

研究の動機と目的

  • 並列学習データを必要とせず、英語および中国語の母語話者および外国語話者に対して高品質な音声合成を可能にすること。
  • 各スプーカーのドメインに限定された少量のデータで、未学習スプーカーのボイスクラーニングを可能にすること。
  • 言語固有の埋め込みおよびプロソディック埋め込みを用いて、音声の自然さとスプーカー類似度を向上させること。
  • スプーカー埋め込み正規化(L2ノルム、ホワイトニング)が音声合成品質およびスプーカー類似度に与える影響を調査すること。
  • 1つの言語(広東語)で学習されたWaveNet音声合成器が、他の言語(中国語、英語)の音声生成に効果的に一般化するかを評価すること。

提案手法

  • 3つの別々に学習されたコンponent(xベクトルスプーカー符号化器、TacotronベースのTTS合成器、WaveNet音声合成器)からなるモジュラーパイプラインを採用する。
  • TTSモデルは3種類の埋め込みに条件づけられる:スプーカー埋め込み(マルチスプーカー学習用)、言語埋め込み(共有音素入力)、トーン/ストレス埋め込み(特にトーン言語である中国語のプロソディを向上)。
  • スプーカー埋め込みはL2ノルムまたはホワイトニングにより正規化され、合成品質およびスプーカー類似度が向上する。
  • WaveNet音声合成器は広東語の音声で学習され、中国語および英語の両方の言語で高精細な音声を生成する。これは音声合成器の言語に依存しない性能を示している。
  • 未学習スプーカーのボイスクラーニングは、わずか数秒のリファレンス音声とスプーカー埋め込みに条件づけて実現される。
  • システムは公開データセット(英語用にLibriSpeech、中国語用にSurfingTech)を用いて学習され、再現性が保証される。

実験結果

リサーチクエスチョン

  • RQ1並列学習データを必要とせず、クロスリンガルマルチスプーカーTTSシステムは、既知および未知の母語話者および外国語話者に対して高品質な母語話者および発音の異なる音声を生成できるか?
  • RQ2スプーカー埋め込み正規化(L2ノルム、ホワイトニング)は、合成音声の聞き取りやすさ、自然さ、スプーカー類似度にどのように影響するか?
  • RQ31つの言語(広東語)で学習されたWaveNet音声合成器は、他の言語(中国語、英語)の高品質な音声生成に効果的に一般化できるか?
  • RQ4特に未学習の外国語話者に対して、合成された外国発音音声のスプーカー類似度は、母語話者の音声と同等か?
  • RQ5トーンおよびストレス埋め込みの導入は、中国語のようなトーン言語における合成音声の自然さを顕著に向上させるか?

主な発見

  • xベクトルスプーカー埋め込みのホワイトニングは、スプーカー類似度と自然さを顕著に向上させ、未学習の母語話者としての中国語話者では4.92 MOS、英語話者でも4.92 MOSを達成した。
  • スプーカー埋め込みのL2正規化は、聞き取りやすさと品質を向上させ、未学習の母語話者としての英語話者では4.92 MOS、中国語話者では4.71 MOSを達成した。
  • ホワイトニングされた埋め込みを用いる際、外国発音英語話者(FNE)および外国発音中国語話者(FNM)のスプーカー類似度は、母語話者中国語(NM)よりも高いことが判明し、発音およびスプーカーのばらつきに対して強い耐性を示した。
  • 広東語で学習されたWaveNet音声合成器は、中国語および英語の両方で高品質な音声を生成し、音声合成器の言語に依存しない性能を示した。
  • 発音の異なる音声の聞き取りやすさと自然さは母語話者音声より低いが、L2正規化により外国語話者英語音声の聞き取りやすさが、正規化なし(2.08)からL2正規化(4.92)に向上した。
  • 未学習スプーカーに対して、ホワイトニングが最も優れた結果を示し、スプーカー類似度は3.81~4.08 MOSを達成した。これは、言語を跨いで未学習スプーカーへの一般化能力が非常に高いことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。