Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Contrastive Predictive Coding for Unsupervised Learning of Disentangled Representations.

Janek Ebbers, Michael Kuhlmann|arXiv (Cornell University)|May 26, 2020
Speech Recognition and Synthesis参考文献 24被引用数 8
ひとこと要約

本稿では、教師なしの音声コンテンツおよび話者要因の分離のため、二重エンコーダーを備えた完全畳み込み型変分オートエンコーダーを提案する。並行データや話者ラベルを一切使用せずに、敵対的対照的予測コーディングを用いることで、未学習話者を含むゼロショット音声変換性能が最先端水準に達する。

ABSTRACT

In this work we tackle disentanglement of speaker and content related variations in speech signals. We propose a fully convolutional variational autoencoder employing two encoders: a content encoder and a speaker encoder. To foster disentanglement we propose adversarial contrastive predictive coding. This new disentanglement method does neither need parallel data nor any supervision, not even speaker labels. With successful disentanglement the model is able to perform voice conversion by recombining content and speaker attributes. Due to the speaker encoder which learns to extract speaker traits from an audio signal, the proposed model not only provides meaningful speaker embeddings but is also able to perform zero-shot voice conversion, i.e. with previously unseen source and target speakers. Compared to state-of-the-art disentanglement approaches we show competitive disentanglement and voice conversion performance for speakers seen during training and superior performance for unseen speakers.

研究の動機と目的

  • 教師なし(話者ラベルや並行データを含めない)で音声信号内の話者要因とコンテンツ要因を分離すること。
  • 未学習のソースおよびターゲット話者からの学習済みコンテンツおよび話者埋め込みのみを用いてゼロショット音声変換を可能にすること。
  • 意味のある話者埋め込みを生成しながら、コンテンツ分離を保持する自己教師付き表現学習手法を開発すること。
  • 従来手法と比較して、未学習話者への一般化性能を向上させること。

提案手法

  • コンテンツ用および話者表現用に専用の二つのエンコーダーを備えた完全畳み込み型変分オートエンコーダーのアーキテクチャ。
  • 時間軸に跨る予測表現の対照をとることで分離を促進するとともに、敵対的訓練によって話者固有特徴を洗練する、敵対的対照的予測コーディングを導入。
  • 将来の潜在状態の対照的予測を通じて、正例ペア間の類似性と負例ペア間の非類似性を促進する対照損失を用いて、分離された表現を学習。
  • 話者エンコーダーは生の音声から話者固有の特徴を抽出し、コンテンツおよび話者埋め込みの再結合によってゼロショット音声変換を可能にする。
  • 訓練中に並行データや話者アノテーションを一切使用せず、自己教師付き対照学習に依存。
  • 分離された表現を用いて、1人の話者のコンテンツを別の話者に移すことで音声を合成し、再訓練なしで音声変換を実現。

実験結果

リサーチクエスチョン

  • RQ1敵対的対照的予測コーディングは、ラベルや並行データを一切使用せずに、話者要因とコンテンツ要因を効果的に分離できるか?
  • RQ2未学習のソースおよびターゲット話者に対して、ゼロショット音声変換に一般化できるか?
  • RQ3見たことのない話者設定下でも、最先端手法と比較して分離品質は向上するか?
  • RQ4本手法は話者ラベルを必要とせずに意味のある話者埋め込みを生成できるか?

主な発見

  • 訓練中に登場した話者についても、競争力のある分離性能および音声変換性能を達成し、最先端のベースラインと同等またはそれを上回る。
  • 未学習話者に対するゼロショット音声変換で優れた性能を示し、学習済み話者埋め込みの一般化能力が優れていることを示している。
  • 話者ラベルや並行データの欠如が性能に悪影響を及えないことから、自己教師付き対照アプローチの有効性が裏付けられた。
  • 話者エンコーダーは生の音声から意味のある話者埋め込みを効果的に学習できており、微調整なしに正確な音声変換が可能である。
  • 敵対的対照的予測コーディング機構により、潜在空間におけるコンテンツおよび話者要因の分離が効果的に促進された。
  • 両方のソースおよびターゲット話者が訓練時に未学習であった場合でも、コンテンツおよび話者属性の再結合によって高品質な音声変換が実現可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。