Skip to main content
QUICK REVIEW

[論文レビュー] Data Efficient Voice Cloning from Noisy Samples with Domain Adversarial Training

Jian Cong, Shan Yang|arXiv (Cornell University)|Aug 10, 2020
Speech Recognition and Synthesis参考文献 28被引用数 4
ひとこと要約

本稿では、音声変換モデルにおけるデータ効率的音声クローン生成を、ノイズの多いターゲットスピーカーのサンプルから実現するため、ドメイン adversarial training (DAT) を提案する。潜在表現における話者アイデンティティとノイズを分離することで、ベースラインモデルや外部音声強調技術を用いたモデルですら、わずかなノイズ付きサンプルでも優れた音声品質と話者類似度を達成する。

ABSTRACT

Data efficient voice cloning aims at synthesizing target speaker's voice with only a few enrollment samples at hand. To this end, speaker adaptation and speaker encoding are two typical methods based on base model trained from multiple speakers. The former uses a small set of target speaker data to transfer the multi-speaker model to target speaker's voice through direct model update, while in the latter, only a few seconds of target speaker's audio directly goes through an extra speaker encoding model along with the multi-speaker model to synthesize target speaker's voice without model update. Nevertheless, the two methods need clean target speaker data. However, the samples provided by user may inevitably contain acoustic noise in real applications. It's still challenging to generating target voice with noisy data. In this paper, we study the data efficient voice cloning problem from noisy samples under the sequence-to-sequence based TTS paradigm. Specifically, we introduce domain adversarial training (DAT) to speaker adaptation and speaker encoding, which aims to disentangle noise from speech-noise mixture. Experiments show that for both speaker adaptation and encoding, the proposed approaches can consistently synthesize clean speech from noisy speaker samples, apparently outperforming the method adopting state-of-the-art speech enhancement module.

研究の動機と目的

  • ターゲットスピーカーのサンプルがノイズを含む場合に、既存の seq2seq TTS システムの性能が低下するという課題に、データ効率的な音声クローン生成の観点から対処すること。
  • クリーンなデータや外部の強調モジュールを必要とせずに、ノイズに対して頑健であるように、話者適応および話者エンコーディング手法を改善すること。
  • ドメイン adversarial training を用いて、潜在表現におけるノイズと話者アイデンティティを分離し、安定的かつ高品質な音声合成を保証すること。
  • ノイズ環境下での少数ショット適応およびワンショットエンコーディングの両状況において、提案手法の有効性を評価すること。

提案手法

  • seq2seq TTS モデルのデコーダーにドメイン adversarial training (DAT) を導入し、クリーンな入力とノイズのある入力を区別するドメイン分類器を学習する。
  • 話者適応フレームワークを改良し、デコーダーにドメイン分類器とノイズ制御タグを追加することで、ファインチューニング中にノイズに依存しない話者表現を学習可能にする。
  • 話者エンコーディングフレームワークを拡張し、ドメイン分類器と外部話者エンコーダーを導入することで、入力音声のノイズに強くても話者埋め込みが安定するようにする。
  • バックプロパゲーション中に勾配反転を適用することでドメイン不変性を強制し、モデルがノイズに依存しない話者固有の特徴を学習するように促進する。
  • クリーンおよびノイズのある話者サンプルの混合データセット上で TTS モデルを訓練し、ドメイン分類器がノイズ依存の特徴学習を妨げるようペナルティを与える。
  • t-SNE 視覚化を用いて、提案手法が同じ話者のノイズあり・ノイズなしサンプルを密にクラスタリングすることを確認する。

実験結果

リサーチクエスチョン

  • RQ1少数のノイズありターゲット話者サンプルでのファインチューニングにおいて、ドメイン adversarial training が話者適応性能を向上させることができるか?
  • RQ2ワンショット話者エンコーディングにおいて、単一のノイズありサンプルを入力として使用した場合、話者類似度と自然さを維持できるか?
  • RQ3提案手法が音声クローン生成の前処理として外部の最先端音声強調モジュールを上回る性能を示すか?
  • RQ4ドメイン adversarial training が、潜在表現におけるノイズと話者アイデンティティの分離をどの程度効果的に実現できるか?
  • RQ5異なる話者性別およびテスト時のノイズレベルの変動に対しても、提案手法は頑健であるか?

主な発見

  • 提案された DAT を用いた話者適応モデルは、ノイズのある女性話者のサンプルに対して、類似度で 3.65、自然さで 3.36 の平均意見スコア(MOS)を達成し、そのデータでは収束しなかったベースラインを上回った。
  • ワンショット話者エンコーディングにおいて、提案手法はノイズのある男性話者のサンプルで類似度スコア 0.88 を達成したのに対し、ベースラインはデノイズド入力で 0.76 にとどまり、優れた頑健性を示した。
  • ドメイン adversarial training を用いたモデルは、クリーン、ノイズあり、デノイズドのテストセットすべてで一貫した性能を維持したが、ベースラインモデルは両適応およびエンコーディング設定においてノイズありデータでは適応に失敗した。
  • t-SNE 視覚化により、提案手法が同じ話者のノイズあり・ノイズなしサンプルを密にクラスタリングしているのに対し、ベースラインモデルは明確に分離されたクラスタを示しており、ノイズに影響を受ける埋め込みであることが確認された。
  • MCD(メルケプストラム歪み)においても、提案手法はデノイジングベースラインを下回り、女性話者適応のノイズありデータで 4.18、デノイジングアプローチで 4.72 を記録した。
  • 話者エンコーディングにおいて、提案手法はノイズのある男性話者のサンプルで類似度の MOS が 3.34 を達成し、デノイズドデータで 2.96 を記録したベースラインを著しく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。