Skip to main content
QUICK REVIEW

[論文レビュー] Residual Adapters for Few-Shot Text-to-Speech Speaker Adaptation

Nobuyuki Morioka, Heiga Zen|arXiv (Cornell University)|Oct 28, 2022
Speech Recognition and Synthesis被引用数 9
ひとこと要約

本稿では、少数のデータで高効率な音声クローンが可能な、パrameter効率の良い音声合成用スプーカー適応のための残差アダプタを提案する。事前学習済みのマルチスプーカーTTSバックボーンを固定し、重要な層に軽量な残差アダプタを挿入することで、1〜5分のターゲットスプーカー音声データを用いても、自然さとスプーカー類似度の両面で競争力のある性能を達成する。また、モデル共有により推論コストを著しく削減できる。

ABSTRACT

Adapting a neural text-to-speech (TTS) model to a target speaker typically involves fine-tuning most if not all of the parameters of a pretrained multi-speaker backbone model. However, serving hundreds of fine-tuned neural TTS models is expensive as each of them requires significant footprint and separate computational resources (e.g., accelerators, memory). To scale speaker adapted neural TTS voices to hundreds of speakers while preserving the naturalness and speaker similarity, this paper proposes a parameter-efficient few-shot speaker adaptation, where the backbone model is augmented with trainable lightweight modules called residual adapters. This architecture allows the backbone model to be shared across different target speakers. Experimental results show that the proposed approach can achieve competitive naturalness and speaker similarity compared to the full fine-tuning approaches, while requiring only $\sim$0.1% of the backbone model parameters for each speaker.

研究の動機と目的

  • 数百人のカスタムボイス用に全モデルを微調整する際の高い計算コストとメモリ消費を低減すること。
  • 最小限のデータで、1つの事前学習済みTTSバックボーンを新しいスプーカーにパrameter効率よく少数回のデータで適応可能にする。
  • モデル共有によるバックボーンの共有を活用し、推論コストを削減しながらも、自然さとスプーカー類似度を高い水準で維持すること。
  • 特に全微調整やゼロショットベースラインと比較して、TTSにおける残差アダプタの有効性を検証すること。
  • アダプタサイズ、配置、およびトレーニングデータ量が適応品質に与える影響を評価すること。

提案手法

  • 事前学習済みマルチスプーカーTTSバックボーンモデルを固定し、特にバリアンスアダプターやデコーダーなどの特定の層に、軽量な残差アダプタモジュールを挿入する。
  • 残差アダプタは、ボトルネックを経由して入力特徴を変換する小さなトレーニング可能な全結合ネットワークであり、パrameter効率の高い適応を可能にする。
  • 適応段階では、バックボーンは固定されたまま、ターゲットスプーカーの少量のデータ(1〜30分)を用いてアダプタパラメータのみを更新する。
  • アダプタは残差接続の形で適用される:出力は元のレイヤー出力とアダプタ出力の和であり、元のモデル挙動を保つ。
  • 推論時に異なるアダプタ重みを読み込むことで、同じ固定バックボーンモデルを複数のスプーカーで共有可能である。
  • 客観的指標(MOS、コサイン類似度)と主観的聴取テストを用いて、異なるデータ量とアダプタ設定の下で評価を実施。

実験結果

リサーチクエスチョン

  • RQ1残差アダプタは、パラメータ更新を最小限に抑えながらも、少数回のデータで競争力あるスプーカー類似度と自然さを達成できるか?
  • RQ2アダプタの配置(例:バリアンスアダプターよりもデコーダー内に挿入)が合成品質に与える影響は?
  • RQ3アダプタサイズやターゲットスプーカーのデータ量が性能に与える影響は?
  • RQ4全微調整やゼロショットベースラインと比較して、本手法の品質と効率性は?
  • RQ51分のデータのみで、高い性能を維持できるか?

主な発見

  • 本手法は、1分のターゲットスプーカー音声データのみを用いても、全微調整と同等の自然さとスプーカー類似度を達成した。
  • 1分のデータを用いた場合、女性スプーカーのコサイン類似度が約0.39に維持され、この低データ環境下で全微調整ベースラインを上回った。
  • デコーダーに挿入した残差アダプタは、バリアンスアダプターよりも優れた性能を示したが、後者は自然さの低下やトーンの問題を引き起こした。
  • バックボーンモデルのパラメータの約0.1%しかスプーカーごとに必要としないため、数百人のボイスへのスケーリングがコスト効率よく可能になった。
  • データ不足に強く、30分から1分にデータ量を減らしても性能低下は最小限に抑えられ、MOSや類似度スコアに顕著な低下は認めなかった。
  • dベクトルを用いたゼロショットベースラインを上回り、極めて少ない条件データでも優れたスプーカー類似度を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。