Skip to main content
QUICK REVIEW

[論文レビュー] Meta-TTS: Meta-Learning for Few-Shot Speaker Adaptive Text-to-Speech

Sung-Feng Huang, Chyi-Jiunn Lin|arXiv (Cornell University)|Nov 7, 2021
Speech Recognition and Synthesis参考文献 32被引用数 8
ひとこと要約

本稿では、モデルに依存しないメタラーニング(MAML)を用いて、マルチスプリーカーFastSpeech 2モデルを訓練することで、少数のサンプルでの迅速なスプリーカー適応を可能にするメタラーニングアプローチ、Meta-TTSを提案する。この手法は、わずか10〜20ステップの適応で高いスプリーカー類似度を達成し、スプリーカー適応およびスプリーカー符号化ベースラインを上回る。特に、8,371人の追加スプリーカーで事前学習されたベースラインですらも、同上を上回る。

ABSTRACT

Personalizing a speech synthesis system is a highly desired application, where the system can generate speech with the user's voice with rare enrolled recordings. There are two main approaches to build such a system in recent works: speaker adaptation and speaker encoding. On the one hand, speaker adaptation methods fine-tune a trained multi-speaker text-to-speech (TTS) model with few enrolled samples. However, they require at least thousands of fine-tuning steps for high-quality adaptation, making it hard to apply on devices. On the other hand, speaker encoding methods encode enrollment utterances into a speaker embedding. The trained TTS model can synthesize the user's speech conditioned on the corresponding speaker embedding. Nevertheless, the speaker encoder suffers from the generalization gap between the seen and unseen speakers. In this paper, we propose applying a meta-learning algorithm to the speaker adaptation method. More specifically, we use Model Agnostic Meta-Learning (MAML) as the training algorithm of a multi-speaker TTS model, which aims to find a great meta-initialization to adapt the model to any few-shot speaker adaptation tasks quickly. Therefore, we can also adapt the meta-trained TTS model to unseen speakers efficiently. Our experiments compare the proposed method (Meta-TTS) with two baselines: a speaker adaptation method baseline and a speaker encoding method baseline. The evaluation results show that Meta-TTS can synthesize high speaker-similarity speech from few enrollment samples with fewer adaptation steps than the speaker adaptation baseline and outperforms the speaker encoding baseline under the same training scheme. When the speaker encoder of the baseline is pre-trained with extra 8371 speakers of data, Meta-TTS can still outperform the baseline on LibriTTS dataset and achieve comparable results on VCTK dataset.

研究の動機と目的

  • 未学習のスプリーカーに対して、わずか数個の登録サンプルでのみ、テキスト対音声システムのパーソナライズを達成すること。
  • 従来のスプリーカー適応手法が数千ステップの微調整を必要とするため、その遅い適応速度を克服すること。
  • 未学習スプリーカーに対して一般化性能が著しく低下するスプリーカー符号化手法の一般化ギャップを低減すること。
  • 最小限の計算コストと適応ステップ数で、効率的かつ高品質なボイスクラーニングを実現すること。
  • メタラーニングが、少数のスプリーカー適応における初期化戦略として優れていることを示すこと。

提案手法

  • スプリーカーに依存するコンponentsに焦点を当て、マルチスプリーカーFastSpeech 2モデルを訓練する際、モデルに依存しないメタラーニング(MAML)を適用する。
  • 二重ループ最適化を採用:内側のループでは少数のスプリーカー適応タスクでモデルを微調整し、外側のループでは高速適応を可能にするメタ初期化を更新する。
  • スプリーカーに依存するモジュールにのみMAMLを適用するように、FastSpeech 2をマルチスプリーカー生成をサポートするように変更。学習可能なスプリーカー埋め込みテーブルを統合する。
  • メタ初期化を訓練することで、わずかな適応ステップ数(例:10〜20)で高品質なボイスクラーニングが達成可能となるようにする。
  • 標準的なスプリーカー適応手法(マルチタスク学習)とスプリーカー符号化手法(事前学習または共同学習済みスプリーカー符号化器を備える)という二つのベースラインと比較する。
  • LibriTTSおよびVCTKデータセット上で、スプリーカー類似度、スプリーカー認証(EER、DET)、合成音声検出(ROC AUC)という指標を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1メタラーニングは、テキスト対音声における高品質なスプリーカー適応に必要な適応ステップ数を著しく削減できるか?
  • RQ2Meta-TTSは、スプリーカー類似度および未学習スプリーカーへの一般化性能において、スプリーカー符号化手法と比べてどのように差をつけるか?
  • RQ310〜20ステップに制限された状況で、メタラーニングベースの適応は、標準的な微調整ベースの適応を上回るか?
  • RQ48,371人の追加スプリーカーで事前学習されたスプリーカー符号化ベースラインでさえも、Meta-TTSがその性能を上回るか?
  • RQ5メタラーニングで得られた初期化は、顕著な微調整を必要とせずに、多様な未学習スプリーカーに一般化できるほど堅牢か?

主な発見

  • Meta-TTSは、わずか10〜20ステップの適応で高いスプリーカー類似度を達成し、数千ステップを要するスプリーカー適応ベースラインよりも著しく高速である。
  • LibriTTSデータセットでは、Meta-TTSは、8,371人の追加スプリーカーで事前学習されたスプリーカー符号化ベースラインを、100ステップ以内で上回る。
  • VCTKデータセットでは、Meta-TTSは、事前学習の利点を持つ最良のスプリーカー符号化ベースラインと同等の性能を達成する。
  • ベースラインのスプリーカー符号化器は、特に共同学習された場合に過学習を起こしやすく、未学習スプリーカーに対する一般化性能が著しく低下する。
  • 合成音声検出の結果から、Meta-TTSが生成する音声は、実際の音声と区別がつきにくく、より現実的であることが示された。
  • EERおよびDET曲線の結果から、Meta-TTSは、特に少数のスプリーカー適応状況において、両方のベースラインよりも高いスプリーカー類似度を実現していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。