Skip to main content
QUICK REVIEW

[論文レビュー] NoiseVC: Towards High Quality Zero-Shot Voice Conversion

Shijun Wang, Damian Borth|arXiv (Cornell University)|Apr 13, 2021
Speech Recognition and Synthesis参考文献 30被引用数 6
ひとこと要約

NoiseVCは、ベクトル量子化(VQ)と対照的予測符号化(CPC)を用いて、言語的コンテンツと話者特性を分離するゼロショット音声変換モデルを提案する。ノイズ増幅を組み合わせることで、並列データや事前学習モデル、テキストトランスクリプトなしで高品質な音声変換を達成し、大規模なコードブックを用いても、分離性と音声品質の両方を維持する。

ABSTRACT

Voice conversion (VC) is a task that transforms voice from target audio to source without losing linguistic contents, it is challenging especially when source and target speakers are unseen during training (zero-shot VC). Previous approaches require a pre-trained model or linguistic data to do the zero-shot conversion. Meanwhile, VC models with Vector Quantization (VQ) or Instance Normalization (IN) are able to disentangle contents from audios and achieve successful conversions. However, disentanglement in these models highly relies on heavily constrained bottleneck layers, thus, the sound quality is drastically sacrificed. In this paper, we propose NoiseVC, an approach that can disentangle contents based on VQ and Contrastive Predictive Coding (CPC). Additionally, Noise Augmentation is performed to further enhance disentanglement capability. We conduct several experiments and demonstrate that NoiseVC has a strong disentanglement ability with a small sacrifice of quality.

研究の動機と目的

  • トレーニング時に未観測のソース・ターゲット話者が存在するゼロショット音声変換の課題に対処すること。
  • 並列データやテキストトランスクリプトに依存せずに、言語的コンテンツと話者特性の分離を向上させること。
  • 低リソース言語環境においても、高品質な音声を維持しながら、強固な分離性を実現すること。
  • 対照的予測符号化(CPC)とノイズ増幅が、コンテンツ表現学習にどの程度効果をもたらすかを調査すること。

提案手法

  • 連続的なエンコーダー特徴を離散的な潜在コードにマッピングするためのベクトル量子化(VQ)を用い、コンテンツ表現学習を可能にする。
  • 将来の量子化コードを文脈から予測する対照的予測符号化(CPC)モジュールを採用し、コンテンツ表現のロバスト性を向上させる。
  • トレーニング中にノイズを含むスペクトログラムとクリアなスペクトログラムを交互に供給することで、話者エンコーダーにノイズ増幅を適用し、分離性を強化する。
  • 入力から話者埋め込みを抽出するための話者エンコーダーを用い、これをコンテンツ埋め込みと連結して復元に使用する。
  • コンテンツ埋め込みと話者埋め込みを連結した入力を、マルチスケールの残差U-Netデコーダーを用いて高精細な波形に再構成する。
  • 再構成損失、VQコミットメント損失、CPCからの対照的予測損失を最適化することで、エンド・ツー・エンドのトレーニングを実現する。

実験結果

リサーチクエスチョン

  • RQ1並列データやテキストトランスクリプトに依存せずに、VQベースの音声変換モデルがコンテンツと話者要因の強固な分離を達成できるか?
  • RQ2対照的予測符号化(CPC)は、ゼロショット音声変換におけるコンテンツ表現学習をどの程度向上させるか?
  • RQ3ボトルネック制約が存在しない状況下で、ノイズ増幅は分離能力を向上させるか?
  • RQ4大規模なコードブックサイズを用いる場合、品質の劣化を避けるために、モデルがどの程度音声品質を維持できるか?
  • RQ5未観測話者に対するゼロショット設定において、本モデルは教師ありまたはベースラインのゼロショット手法と比較してどの程度の性能を示すか?

主な発見

  • ノイズ増幅なしでは、コンテンツ埋め込みにおける話者分類精度が59%であったが、CPCを追加すると20%に低下し、分離性の向上が示された。
  • ノイズ増幅(α = 0.5)を適用した場合、話者分類精度はさらに22%に低下し、再構成品質を維持したまま分離性が向上していることが確認された。
  • 未観測話者に対するゼロショット変換において、音声類似度の平均意見スコア(MOS)が4.2を達成し、ベースラインモデルを上回った。
  • NoiseVCの音声品質MOSスコアは高く(約4.0)、特に並列データやテキストの監視が存在しない状況でも良好な知覚的品質を示している。
  • t-SNE可視化により、20人の未観測話者の話者埋め込み空間に明確なクラスタリングが確認され、話者分類精度は98.9%であった。
  • 大規模なコードブックを用いても、再構成損失が低く保たれ、ボトルネック制約のあるモデルで見られる劣化を回避していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。