Skip to main content
QUICK REVIEW

[論文レビュー] Voice Cloning: a Multi-Speaker Text-to-Speech Synthesis Approach based on Transfer Learning

G. Ruggiero, Enrico Zovato|arXiv (Cornell University)|Feb 10, 2021
Speech Recognition and Synthesis参考文献 24被引用数 6
ひとこと要約

本稿では、最小限のターゲットスピーカー音声データで音声クローンが可能な転移学習を用いたマルチスプーカーTTSシステムを提案する。事前学習済みスプーカー検証モデルからの発話レベル埋め込みを活用することで、短いリファレンスクリップを条件として音声合成を制御し、未学習スプーカーに対しても高いスプーカー類似度と耐性を達成した。テストデータにおけるスプーカー検証EERは0.040であった。

ABSTRACT

Deep learning models are becoming predominant in many fields of machine learning. Text-to-Speech (TTS), the process of synthesizing artificial speech from text, is no exception. To this end, a deep neural network is usually trained using a corpus of several hours of recorded speech from a single speaker. Trying to produce the voice of a speaker other than the one learned is expensive and requires large effort since it is necessary to record a new dataset and retrain the model. This is the main reason why the TTS models are usually single speaker. The proposed approach has the goal to overcome these limitations trying to obtain a system which is able to model a multi-speaker acoustic space. This allows the generation of speech audio similar to the voice of different target speakers, even if they were not observed during the training phase.

研究の動機と目的

  • 未学習スプーカーの音声クローンを、リファレンス音声を数秒分だけ用いて行えるデータ効率の良いTTSシステムの開発を目的とする。
  • 各スプーカーごとに再訓練を要する単一スプーカーTTSモデルの制限を克服し、新しいスプーカーに対し再訓練なしにマルチスプーカー合成を可能にする。
  • 固定スプーカー埋め込みではなく発話埋め込みを用いることで、未学習スプーカーへの一般化を向上させ、音声クローン性能を向上させる。
  • 合成音声における声のトーンやスプーカーの個性を保持できるかを評価する。
  • 事前学習済みスプーカー検証モデルからの転送学習が、エンドツーエンド音声クローンにどのように寄与するかを実証する。

提案手法

  • 本システムは3つのコンponentから構成されるアーキテクチャを採用:スプーカー符号化器、アテンションを備えた系列対系列合成器、ニューラルボコーダー。
  • スプーカー符号化器は、転移学習により事前学習済みスプーカー検証モデルを用いて、短いリファレンス音声クリップから発話埋め込みを計算する。
  • 合成器は、固定スプーカー埋め込みではなく、テキストと発話埋め込みベクトルの両方を条件としてメルスペクトログラムを生成する。
  • ボコーダーは生成されたメルスペクトログラムを時間領域波形に変換する。
  • スプーカー符号化器は、検証セットにおけるスプーカー検証誤差(SV-EER)を最小化するように学習され、判別可能なスプーカー表現を保証する。
  • 本システム全体は、合成損失とスプーカー埋め込みの一貫性を組み合わせたマルチタスク目的関数によりエンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1数秒分のリファレンス音声のみで、TTSシステムが未学習スプーカーに一般化可能か?
  • RQ2固定スプーカー埋め込みではなく発話埋め込みを用いることで、ゼロショット音声クローン性能が向上するか?
  • RQ3事前学習済みスプーカー検証モデルからの転送学習が、合成音声におけるスプーカー個性の保持にどの程度寄与するか?
  • RQ4本手法は、ベースライン手法と比較して、スプーカー類似度と合成品質の面で優れているか?
  • RQ5各スプーカーに対して再訓練なしに、高い声のトーン類似度を維持できるか?

主な発見

  • 提案手法はテストセットにおいてスプーカー検証等価誤差(SV-EER)0.040を達成し、ベースラインシステム(0.049)を上回った。
  • 高度なGRUベースのスプーカー符号化器アーキテクチャは、最良のSV-EERを達成し、標準GRUネットワークよりも学習時に顕著に高速であった。
  • 8名のテストスプーカーにおいて、生成された発話埋め込みと正解発話埋め込みのコサイン類似度は0.56〜0.76の範囲にあり、強力なスプーカー表現の整合性を示した。
  • 主観的平均類似度スコア(MSS)は、提案手法で5点中3.17、ベースラインで2.59を記録し、認識上のスプーカー類似度の向上を示した。
  • 発話埋め込みをUMAPで投影した結果、性別および個体識別に基づき明確なクラスタリングが確認され、強固なスプーカー表現学習が行われたことを裏付けた。
  • 改善は見られたが、システムは完全には人間並みの自然さに達しておらず、プロソディの再現が依然として制限要因であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。