Skip to main content
QUICK REVIEW

[論文レビュー] Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation

Dongchan Min, Dong Bok Lee|arXiv (Cornell University)|Jun 6, 2021
Speech Recognition and Synthesis被引用数 45
ひとこと要約

Meta-StyleSpeech は StyleSpeech をメタ学習と識別器で拡張し、マルチ話者 TTS におけるワンショット・短参照話者適応を強力に実現します。<1秒未満の参照音声からでも高品質で話者一貫性のある合成を提供します。

ABSTRACT

With rapid progress in neural text-to-speech (TTS) models, personalized speech generation is now in high demand for many applications. For practical applicability, a TTS model should generate high-quality speech with only a few audio samples from the given speaker, that are also short in length. However, existing methods either require to fine-tune the model or achieve low adaptation quality without fine-tuning. In this work, we propose StyleSpeech, a new TTS model which not only synthesizes high-quality speech but also effectively adapts to new speakers. Specifically, we propose Style-Adaptive Layer Normalization (SALN) which aligns gain and bias of the text input according to the style extracted from a reference speech audio. With SALN, our model effectively synthesizes speech in the style of the target speaker even from single speech audio. Furthermore, to enhance StyleSpeech's adaptation to speech from new speakers, we extend it to Meta-StyleSpeech by introducing two discriminators trained with style prototypes, and performing episodic training. The experimental results show that our models generate high-quality speech which accurately follows the speaker's voice with single short-duration (1-3 sec) speech audio, significantly outperforming baselines.

研究の動機と目的

  • わずか数短い音声サンプルだけで新しい話者に適応できる、高品質で表現力のあるマルチ話者 TTS を促進する。
  • 参照話者の声と韻律に合成を条件づけるスタイル適応正規化機構を導入する。
  • 未知の話者への適応を、敵対的識別器とスタイルプロトタイプを用いたメタ学習で強化する。
  • 見知り話者および未知話者タスクで最先端の性能を示し、超短い参照音声シナリオを含む。

提案手法

  • 参照発話から抽出されたスタイルベクトルに基づき特徴のゲインとバイアスを整合させる Style-Adaptive Layer Normalization (SALN) を用いた StyleSpeech を提案する。
  • StyleSpeech を、スタイルプロトタイプを備えたスタイル識別器と音素識別器を追加して Meta-StyleSpeech に拡張し、ワンショット適応のエピソディックなメタ学習を可能にする。
  • メル式エンコーダを用いて参照音声からスタイルベクトルを抽出し、SALN を FFT ベースの音素エンコーダと mel-スペクトログラムデコーダに入力する FastSpeech2 系ジェネレーターに供給する。
  • 見知り話者での再構成損失と、未知話者適応のための2つの識別器からの adversarial 損失(LS-GAN)、およびスタイルプロトタイプ分類目的で学習する。
  • エピソディック訓練を実施し、各エピソードでサポート/クエリの分割をシミュレートして未知話者への一般化を向上させる。

実験結果

リサーチクエスチョン

  • RQ1StyleSpeech は高品質でマルチ話者の音声を合成し、単一の短い参照音声で新しい話者に適応できるか?
  • RQ2識別器を用いたメタ学習は、メタ学習を行っていないベースラインと比較して未知話者への適応品質を改善するか?
  • RQ3未知話者に対する適応は、参照音声の長さによってどう影響を受けるか?
  • RQ4未知話者への適応におけるスタイル識別器・音素識別器・スタイルプロトタイプの寄与は何か?
  • RQ5見知り・未知の状況を問わず、客観的・主観的指標で生成音声がターゲット話者の声にどれだけ近づくか?

主な発見

  • StyleSpeech は、見知り話者に対してベースラインより高い MOS を達成し、MCD/WER が低い。
  • Meta-StyleSpeech は、評価対象モデルの中で Seen speakers に関して最良の性能を達成。
  • 未知話者に対しては、MOS、MCD、WER、声の類似性で baseline を上回る。
  • 1 秒未満の参照音声を用いた適応は Meta-StyleSpeech により大幅に改善され、すべての参照長において StyleSpeech を上回る。
  • アブレーション研究は、未知話者への適応における音素識別器・スタイル識別器・スタイルプロトタイプの重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。