[論文レビュー] Zero-Shot Multi-Speaker Text-To-Speech with State-of-the-art Neural Speaker Embeddings
本稿では、最新のニューラルスプーカー埋め込み、特にアングルソフトマックス損失を用いた学習可能ディクショナリーエンコーディング(LDE)を用いて、ゼロショットマルチスプーカー音声合成を提案する。従来のx-ベクトルと比較して、未学習スプーカーのスプーカー類似度と自然さが顕著に向上する。最も優れたシステム(LDE-3)は、未学習テストスプーカーにおいて、スプーカー類似度(DMOS 2.46)と自然さ(MOS 3.48)の両面で統計的に優れた結果を達成し、それぞれp=0.02およびp=5.9e-11の有意差を示した。
While speaker adaptation for end-to-end speech synthesis using speaker embeddings can produce good speaker similarity for speakers seen during training, there remains a gap for zero-shot adaptation to unseen speakers. We investigate multi-speaker modeling for end-to-end text-to-speech synthesis and study the effects of different types of state-of-the-art neural speaker embeddings on speaker similarity for unseen speakers. Learnable dictionary encoding-based speaker embeddings with angular softmax loss can improve equal error rates over x-vectors in a speaker verification task; these embeddings also improve speaker similarity and naturalness for unseen speakers when used for zero-shot adaptation to new speakers in end-to-end speech synthesis.
研究の動機と目的
- 最先端のニューラルスプーカー埋め込みが、エンドツーエンド音声合成におけるゼロショットスプーカー適応に寄与するかどうかを調査すること。
- スプーカー識別に特化した埋め込みが、TTSにおける未学習スプーカーのスプーカー類似度と自然さを向上させるかどうかを検証すること。
- 特にLDEにアングルソフトマックスを組み合わせた埋め込みタイプを、標準のx-ベクトルと比較し、ゼロショットTTSにおける有効性を評価すること。
- 自動スプーカー識別(ASV)で最も優れた性能を示す埋め込みが、TTSでも最も優れた結果をもたらすかどうかを評価すること。
- ASV性能(EER)とTTS品質指標(MOS、DMOS)との間に相関関係があるかどうかを特定すること。
提案手法
- プレネットおよびアテンション機構にスプーカー埋め込みを統合できるように、改善されたTacotronモデルを拡張し、マルチスプーカーTTSを実装した。
- 14種類のLDE埋め込みとx-ベクトルの15種類の異なるスプーカー埋め込みタイプを用いて、15体のTTSモデルを学習した。それぞれの埋め込みタイプは、後処理正規化(N)あり・なしの2通りの設定を含む。
- フレームレベル表現から固定次元の発話レベル埋め込みを生成するために、学習可能ディクショナリーエンコーディング(LDE)をプーリング層として採用した。
- スプーカー空間における分離能の向上と埋め込みクラスタリングの改善を目的に、スプーカー埋め込みネットワークの学習時にアングルソフトマックス損失を適用した。
- 一般化性能の向上と学習済みスプーカーへの過学習の低減を図るため、性別に応じた学習設定を採用した。
- 463名の被験者を対象にクラウドソーシングによる聴取テストを実施し、ターゲットスプーカーの参照発話を利用した未学習スプーカーに対するMOS(自然さ)およびDMOS(スプーカー類似度)を評価した。
実験結果
リサーチクエスチョン
- RQ1最先端のスプーカー埋め込み、特にアングルソフトマックスを用いたLDEが、エンドツーエンドTTSにおける未学習スプーカーのゼロショットスプーカー適応を向上させるか?
- RQ2大規模かつ多様なスプーカー識別データで学習されたスプーカー埋め込みを用いることで、x-ベクトルと比較してTTSにおけるスプーカー類似度と自然さが向上するか?
- RQ3自動スプーカー識別(ASV)性能(EER)とTTS品質指標(MOS、DMOS)との間に相関関係があるか?
- RQ4どの特定の埋め込みアーキテクチャと学習目的の組み合わせが、未学習スプーカー合成で最も優れた性能を発揮するか?
- RQ5後処理正規化(N)は、さまざまな埋め込みタイプにおいてTTS品質やスプーカー類似度を顕著に向上させるか?
主な発見
- LDE-3埋め込み設定が、未学習テストスプーカーにおいて最高のMOS(3.48)とDMOS(2.46)を達成し、x-ベクトルを有意に上回った(MOS: p=5.9e-11、DMOS: p=0.02)。
- LDEベースの埋め込みは、未学習スプーカーのスプーカー類似度と自然さの両方を向上させた。特にLDE-3が最も優れたバージョンであり、未学習スプーカーにおいてx-ベクトルと比較してDMOSが1.5ポイント向上した。
- LDE-3システムは、すべての埋め込みの中で最も低い等誤差率(EER)を達成し、スプーカー識別における優れた分離能を裏付けた。
- ASV性能(EER)とTTS品質指標(MOSまたはDMOS)との間に有意義な相関は認められず、高いASV精度が必ずしも優れたTTS性能を示すとは限らないことが示された。
- 後処理正規化(N)は性能にほとんど影響を与えず、単なる正規化よりも、コアとなる埋め込みアーキテクチャと学習目的が、より重要であることが示唆された。
- 改善は見られたが、未学習スプーカーのスプーカー類似度は、学習済みスプーカーと比較して依然として顕著に低く、学習スプーカーへの過学習が継続しており、さらなる改善の余地があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。