[論文レビュー] Meta-Voice: Fast few-shot style transfer for expressive voice cloning using meta learning
Meta-Voiceは、事前学習済みのマルチスプーカー・マルチプロソディTTSモデルを用いて、わずか5音声(約12秒)で100ステップの適応のみで高品質な表現的ボイスクラーニングを実現するメタラーニングアプローチを提案する。スタイル固有のパラメータにモデルに依存しないメタラーニング(MAML)を適用し、ドメインアダプティブトレーニングと直交制約を用いてスプーカー・プロソディの分離を実現することで、少数のデータでも高速かつ高精度なボイスクラーニングを達成する。
The task of few-shot style transfer for voice cloning in text-to-speech (TTS) synthesis aims at transferring speaking styles of an arbitrary source speaker to a target speaker's voice using very limited amount of neutral data. This is a very challenging task since the learning algorithm needs to deal with few-shot voice cloning and speaker-prosody disentanglement at the same time. Accelerating the adaptation process for a new target speaker is of importance in real-world applications, but even more challenging. In this paper, we approach to the hard fast few-shot style transfer for voice cloning task using meta learning. We investigate the model-agnostic meta-learning (MAML) algorithm and meta-transfer a pre-trained multi-speaker and multi-prosody base TTS model to be highly sensitive for adaptation with few samples. Domain adversarial training mechanism and orthogonal constraint are adopted to disentangle speaker and prosody representations for effective cross-speaker style transfer. Experimental results show that the proposed approach is able to conduct fast voice cloning using only 5 samples (around 12 second speech data) from a target speaker, with only 100 adaptation steps. Audio samples are available online.
研究の動機と目的
- 新しいスプーカーに対して限られたデータ(例:5発話)しか入手できない少数の音声データで、高速で少ないショットのスタイル転送を実現する課題に対処すること。
- 低データ環境下でのボイスクラーニングにおいて、モデル容量と過学習のトレードオフを克服すること。
- TTSモデルの新しいスプーカーの声に迅速に適応させつつ、表現的なプロソディ転送を維持すること。
- スプーカー識別子とプロソディ表現を分離し、効果的なクロススプーカーのスタイル転送を可能にすること。
- 標準的な微調整ベースラインと比較して、適応速度と効率を向上させ、計算コストと処理時間を削減すること。
提案手法
- 事前学習済みのマルチスプーカー・マルチプロソディTTSモデルのスタイル固有パラメータを最適化するため、モデルに依存しないメタラーニング(MAML)を採用し、高速な適応を実現する。
- モデルパラメータを共有パラメータ(事前学習から転送)とスタイル固有パラメータ(メタラーニングで最適化)に分解する。
- 潜在空間におけるスプーカーとプロソディ表現の分離を図るため、勾配反転層(GRL)を用いたドメインアダプティブトレーニングを適用する。
- スプーカーとプロソディベクトルに直交制約を課すことにより、表現の分離性と一般化性能を向上させる。
- 推論時における学習済みスタイル埋め込みに条件づけるために、スタイル適応型層正規化(SALN)機構を採用する。
- スプーカーとプロソディ制御の重み付き損失を組み合わせた損失関数を用い、71時間分の大規模なマルチスプーカー・マルチプロソディコーパスでベースTTSモデルを事前学習した後、メタラーニングを実施する。
実験結果
リサーチクエスチョン
- RQ1メタラーニングは、少数の音声データで高品質で表現的なボイスクラーニングを実現しつつ、適応を高速化できるか?
- RQ2MAMLベースの適応は、最小限のデータで高スプーカー類似度を達成するためのステップ数をどれほど削減できるか?
- RQ3ドメインアダプティブトレーニングと直交制約は、低データ環境下でスプーカー識別子とプロソディの分離をどの程度効果的に向上できるか?
- RQ4標準的な微調整ベースラインと比較して、Meta-Voiceは適応速度と最終的な性能において優れているか?
- RQ55つの短い発話のみで、性別やスプーカータイプを問わず、クロススプーカーのスタイル転送において一般化性能を示せるか?
主な発見
- Meta-Voiceは、100ステップの適応ステップで、1スプーカーあたり5音声(約12秒)のみで、スプーカー類似度(コサイン類似度)が0.7を超える高い性能を達成する。
- ベースラインモデルは、Meta-Voiceと同等のスプーカー類似度とメルケプストラム歪度(MCD)に到達するまでにはるかに多くの適応ステップを要するが、これによりMeta-Voiceの優れた適応速度が裏付けられる。
- 十分な微調整を経ると、ベースラインモデルはMeta-Voiceの性能に到達することが確認され、Meta-Voiceの主な利点が高速収束にあることが示された。
- ドメインアダプティブトレーニングと直交制約は、スプーカー識別子とプロソディ表現の分離を効果的に実現し、頑健なクロススプーカーのスタイル転送を可能にした。
- 本手法は、同一性別および異性別のスタイル転送においても有効であり、さまざまなスプーカータイプにおいて一貫した性能を示した。
- 本手法の効果を確認するための音声サンプルがオンラインで公開されており、生成音声の実用性と聴覚的品質が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。