Skip to main content
QUICK REVIEW

[論文レビュー] VAW-GAN for Singing Voice Conversion with Non-parallel Training Data

Junchen Lu, Kun Zhou|arXiv (Cornell University)|Aug 10, 2020
Speech Recognition and Synthesis参考文献 43被引用数 10
ひとこと要約

本論文は、VAW-GANを用いた非並列音声変換フレームワークを提案し、条件付きデコーダーを介して発音内容から歌手の個体差とF0コントロールを分離する。F0と歌手個体差を条件としてデコーダーに与えることで、並列データを必要とせず高品質な音声変換を実現し、内性別および異性別設定においてスペクトル類似度、音声品質、歌手類似度の面でベースライン手法を上回る性能を発揮する。

ABSTRACT

Singing voice conversion aims to convert singer's voice from source to target without changing singing content. Parallel training data is typically required for the training of singing voice conversion system, that is however not practical in real-life applications. Recent encoder-decoder structures, such as variational autoencoding Wasserstein generative adversarial network (VAW-GAN), provide an effective way to learn a mapping through non-parallel training data. In this paper, we propose a singing voice conversion framework that is based on VAW-GAN. We train an encoder to disentangle singer identity and singing prosody (F0 contour) from phonetic content. By conditioning on singer identity and F0, the decoder generates output spectral features with unseen target singer identity, and improves the F0 rendering. Experimental results show that the proposed framework achieves better performance than the baseline frameworks.

研究の動機と目的

  • 並列学習データが不要な音声変換システムの開発。並列データ収集は費用がかかり、実用的ではない。
  • 発音内容から歌手個体差とF0コントロールを分離し、制御性と変換精度を向上させる。
  • 非並列設定においてF0条件付きで、音声品質と歌手類似度を向上させる。
  • 学習パイプラインから時間的アライメント、ASR、外部モジュールの依存を排除する。
  • 非並列音声変換におけるF0条件付きの有効性を実証し、本分野における新規貢献を示す。

提案手法

  • VAW-GANベースのエンコーダ-デコーダアーキテクチャを用い、歌手個体差、F0コントロール、発音内容の分離表現を学習する。
  • エンコーダーは入力音声を、歌手個体差やF0に依存しない潜在コードに変換し、異名の歌手間変換を可能にする。
  • デコーダーは潜在コード、ターゲットの歌手個体差、F0コントロールを条件として、スペクトル特徴(MCEPs)を再構築し、ターゲットスタイルの音声を生成する。
  • F0条件付きの入力をデコーダーに明示的に組み込むことで、F0再現性とスペクトル精度が向上する。
  • 敵対的損失、再構築損失、VAEベースのKL正則化項を用いて、エンドツーエンドで学習する。
  • VAEベースのアーキテクチャの分離性のおかげで、強制的アライメントや並列データの必要性が回避され、非並列学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1非並列音声変換システムは、並列学習データを一切必要とせず、高品質な音声変換を達成できるか?
  • RQ2デコーダーにF0を条件として与えることで、スペクトル精度と音声品質が向上するか?
  • RQ3歌手個体差とF0コントロールの分離表現学習により、制御性と変換性能が向上するか?
  • RQ4F0条件付きの本手法と、F0条件なしのベースラインモデルを、客観的および主観的指標で比較した場合、どのような差が生じるか?
  • RQ5本フレームワークは、内性別および異性別音声変換タスクにどの程度一般化可能か?

主な発見

  • 提案されたVAW-GAN (SID+F0) フレームワークは、男性→男性変換で平均MCD 5.51 dB、男性→女性変換で6.57 dBを達成し、ベースラインVAW-GAN (SID) の6.20 dBおよび7.39 dBを上回る。
  • 主観評価のMOSでは、男性→男性変換で3.03 ± 0.28、男性→女性変換で2.90 ± 0.31を記録し、顕著に向上した音声品質を示す。
  • XAB好みテストでは、男性→男性変換で84.7%の被験者が本手法を好んだ一方、男性→女性変換では56.7%であり、優れた歌手類似度を示している。
  • F0条件付き機構により、F0再現性とスペクトル忠実度が顕著に向上し、MCD低減とMOSスコア上昇によって裏付けられている。
  • 並列データ、時間的アライメント、ASRなどの外部モジュールを一切不要とし、学習パイプラインが簡素化された。
  • 歌手個体差とF0を潜在コードから分離できることにより、多対多音声変換が有効に実現可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。