Skip to main content
QUICK REVIEW

[論文レビュー] Phonetic Posteriorgrams based Many-to-Many Singing Voice Conversion via Adversarial Training

Haohan Guo, Heng Lu|arXiv (Cornell University)|Dec 3, 2020
Music and Audio Processing参考文献 26被引用数 10
ひとこと要約

本稿では、MelGANベースの生成器とCNN-BLSTMエンコーダーを用い、発音後退確率グラム(PPG)、F0、スケーラー埋め込みを入力として高精細な歌唱波形を生成するエンドツーエンドの対抗的音声変換(EA-SVC)システムを提案する。主な貢献は、スケーラー埋め込みのトーンクラスタへの分解、PPGからのピッチ/トーン漏れを除去するための特徴分離識別器の導入、二段階訓練戦略の採用であり、これらにより、段階的およびWaveNetベースの手法に比べ優れた歌唱品質とスケーラー類似度が達成された。

ABSTRACT

This paper describes an end-to-end adversarial singing voice conversion (EA-SVC) approach. It can directly generate arbitrary singing waveform by given phonetic posteriorgram (PPG) representing content, F0 representing pitch, and speaker embedding representing timbre, respectively. Proposed system is composed of three modules: generator $G$, the audio generation discriminator $D_{A}$, and the feature disentanglement discriminator $D_F$. The generator $G$ encodes the features in parallel and inversely transforms them into the target waveform. In order to make timbre conversion more stable and controllable, speaker embedding is further decomposed to the weighted sum of a group of trainable vectors representing different timbre clusters. Further, to realize more robust and accurate singing conversion, disentanglement discriminator $D_F$ is proposed to remove pitch and timbre related information that remains in the encoded PPG. Finally, a two-stage training is conducted to keep a stable and effective adversarial training process. Subjective evaluation results demonstrate the effectiveness of our proposed methods. Proposed system outperforms conventional cascade approach and the WaveNet based end-to-end approach in terms of both singing quality and singer similarity. Further objective analysis reveals that the model trained with the proposed two-stage training strategy can produce a smoother and sharper formant which leads to higher audio quality.

研究の動機と目的

  • 任意のトーン転送を可能にし、高音質かつスケーラー類似度の高いエンドツーエンドの歌唱音声変換システムを開発すること。
  • 歌唱音声変換におけるコンテンツ、ピッチ、トーン表現の相関性に起因する課題を解決し、特徴の分離を確保すること。
  • 対抗的学習と二段階訓練戦略、マルチスケールSTFT損失を統合することで、音声再現性と安定性を向上させること。
  • 分離されたスケーラー埋め込みの分解により、制御可能なトーン転送とピッチ操作を可能とすること。
  • 主観的および客観的評価において、従来の段階的およびWaveNetベースのエンドツーエンド手法を上回ること。

提案手法

  • MelGANベースの生成器が、PPG、F0、スケーラー埋め込みを入力として波形を出力する。PPGとF0の順序的文脈を抽出するために、並列なCNN-BLSTMエンコーダーを用いる。
  • スケーラー埋め込みを、個別のトーン/スケーラークラスタを表すトレーニング可能なベクトルの重み付き和に分解することで、トーン表現の安定性と制御性を向上させる。
  • 二つの識別器を採用:$D_A$ は波形生成のためのリアルさ向上に、$D_F$ は符号化されたPPGからピッチとスケーラー情報を分離するための目的を有する。
  • 二段階訓練戦略を用いる:まずマルチスケールSTFT(MR-STFT)損失による事前学習を行い、その後MR-STFT損失と対抗的損失を併用した共同学習によりGAN学習の安定性を向上させる。
  • 特徴分離識別器 $D_F$ は、符号化されたPPGからF0とスケーラー埋め込みを予測するように学習させ、PPG表現がピッチおよびトーン情報を含まないよう強制する。
  • エンドツーエンドで対抗的損失と再構成損失を用いて学習することで、コンテンツ、ピッチ、トーン特徴から直接波形を生成可能となる。

実験結果

リサーチクエスチョン

  • RQ1単一のエンドツーエンドモデルが、任意のトーン転送と安定したピッチ制御を実現する高品質な歌唱音声変換を達成できるか?
  • RQ2スケーラー埋め込みのトーンクラスタへの分解は、トーン表現の向上と変換の制御性にどの程度寄与するか?
  • RQ3特徴分離識別器($D_F$)の導入により、PPG表現からのピッチおよびトーン漏れが低減され、音声品質が向上するか?
  • RQ4二段階訓練戦略は、歌唱音声変換における対抗的学習の安定性と性能にどの程度寄与するか?
  • RQ5本手法は、段階的およびWaveNetベースのエンドツーエンド手法に比べ、歌唱品質およびスケーラー類似度の面でどの程度優れているか?

主な発見

  • 提案されたEA-SVCモデルは、歌唱品質の平均意見スコア(MOS)が3.78 ± 0.11、スケーラー類似度が3.60 ± 0.13を達成し、段階的アプローチおよびWaveNetベースのエンドツーエンド手法を上回った。
  • アブレーションスタディの結果、スケーラー埋め込みの分解と$D_F$の両方を除去した場合が最も悪い性能(品質:3.26 ± 0.11)を示し、両者の必要性を裏付けた。
  • スケーラー埋め込みの分解のみを適用したモデルでは、MOSが3.52 ± 0.12(品質)および3.55 ± 0.12(類似度)に向上し、トーン表現のロバスト性が向上したことが示された。
  • 特徴分離識別器$D_F$の導入により、ピッチのちらつきやフォルマントのぼやけが顕著に減少し、スペクトログラムで明瞭でシャープなフォルマントが得られた。
  • 二段階訓練戦略を採用したモデルは、対抗的損失のみで学習したモデルに比べ、スペクトログラム比較で滑らかでシャープなフォルマントを示した。
  • トーン転送実験では、分解によりトーン間の線形的かつ制御可能な補間が可能である一方、非分解モデルでは一貫したスペクトルトレンドを維持できなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。