[論文レビュー] Fitting New Speakers Based on a Short Untranscribed Sample
本稿では、トランスクリプトのない短い音声サンプルから、主な合成モデルと共同で訓練された専用のスピーカー埋め込みネットワークを用いて、新しいスピーカーをフィットするフィードフォワードニューラルTTSシステムを提案する。サイクル損失や対照損失といった一貫性損失を採用することで、1.5秒のサンプルからでも高品質なボイスクラーニングを実現し、従来のVoiceLoopよりも音声品質およびスピーカー識別性の保持において優れている。
Learning-based Text To Speech systems have the potential to generalize from one speaker to the next and thus require a relatively short sample of any new voice. However, this promise is currently largely unrealized. We present a method that is designed to capture a new speaker from a short untranscribed audio sample. This is done by employing an additional network that given an audio sample, places the speaker in the embedding space. This network is trained as part of the speech synthesis system using various consistency losses. Our results demonstrate a greatly improved performance on both the dataset speakers, and, more importantly, when fitting new voices, even from very short samples.
研究の動機と目的
- 短いトランスクリプトなし音声サンプルのみを用いて、新しいスピーカー向けの高品質な音声合成を可能にすること。
- トランスクリプトデータと多数のスピーカー固有の訓練データを必要とする従来のマルチスピーカーTTSシステムの限界を克服すること。
- トランスクリプトの監視なしに、実世界の短いサンプルからもスピーカーの個性を捉え、合成できることを示すこと。
- 反復最適化を伴わずに、1つのネットワークがプリミングによって複数のスピーカーを模倣できるかどうかを検証すること。
- 一貫性損失(LcycleおよびLcontrast)が、最適化なしに堅牢な即時のスピーカー埋め込み学習を可能にする有効性を検証すること。
提案手法
- 主な合成モデルと共同で訓練されるスピーカー適合ネットワークNsを導入し、ラックアップテーブル(LUT)スピーカー埋め込みの代わりに、フィードフォワード方式で短い音声サンプルをスピーカー埋め込みにマップする。
- 複数の一致損失を用いて、NsとTTSモデルを共同で訓練する:Lcycleは、埋め込みから元の音声を再構築した場合に、同じ埋め込みが得られることを保証する。
- サイクル一貫性損失(Lcycle)を用い、再構築音声の埋め込みが元の入力音声の埋め込みと一致することを強制する。
- 対照損失(Lcontrast)を用い、異なるスピーカーの埋め込みを埋め込み空間内で分離させることで、スピーカー識別性を向上させる。
- 生の音声または音声生成器特徴量を用いたエンドツーエンドの訓練と推論を可能にするVoiceLoop TTSフレームワーク内に本手法を適用する。
- 本システムはVCTK(VCTK85)のサブセットで訓練され、訓練済みのスピーカー(VCTK16)およびVoxCelebやLibriSpeechの未訓練のスピーカーで評価される。
実験結果
リサーチクエスチョン
- RQ1トランスクリプトがなくても、短いトランスクリプトなし音声サンプルからニューラルTTSシステムが新しいスピーカーの声を正確にフィットできるか?
- RQ2LcycleおよびLcontrastの一致損失は、最適化なしに堅牢な即時のスピーカー埋め込み学習を可能にするか?
- RQ3明示的なスピーカー固有の訓練やファインチューニングなしに、1つのネットワークがプリミングにより複数のスピーカーを模倣できるか?
- RQ485人の多様なスピーカーからなる小さなデータセットで訓練することで、はるかに大きな未訓練のスピーカー集団への一般化が可能か?
- RQ5動的で即時のスピーカー埋め込みシステムは、固定された事前学習済みのスピーカー埋め込みと同等またはそれ以上の性能を達成できるか?
主な発見
- 本手法は、1.5秒のテストデータでのみ、VCTK16でMOSスコア3.84 ± 0.92を達成し、VoiceLoopの2.92 ± 1.08を顕著に上回った。
- 1.5秒のサンプルにおいて、本手法はトップ1のスピーカー識別正答率73.72%を達成したのに対し、VoiceLoopは52.55%であった。これは、より優れたスピーカー埋め込み品質を示している。
- アブレーションスタディの結果、Lcycleを削除すると正答率が77.37%に低下し、Lcontrastを削除すると56.20%に低下することが判明。両損失が性能向上に不可欠であることが証明された。
- フィットした声の平均MCDは、VCTK16で14.47 ± 0.83を達成し、VoiceLoopの14.72 ± 0.97を上回った。
- t-SNE可視化により、Lcycleが未訓練の声のスピーカー埋め込み分離を顕著に改善することが確認された。
- プリミングベースの1ネットワークアプローチは、わずか1秒の音声で妥当なボイス模倣を達成した。これは、反復最適化なしにスピーカー個性を捉えることが可能であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。