Skip to main content
QUICK REVIEW

[論文レビュー] Latent Space Explorations of Singing Voice Synthesis using DDSP

Juan Carlos Vila Alonso, Cumhur Erkut|arXiv (Cornell University)|Mar 12, 2021
Music and Audio Processing参考文献 22被引用数 6
ひとこと要約

本論文では、わずかな未処理音声データセットを用いて12時間の学習後、ピッチとアモニチュードの条件付けのみで現実的でヴォーカリスト識別可能なボーカルを生成する、軽量なDDSPベースのアーキテクチャを提示する。MFCCから導出された潜在空間表現を導入することで、発話の明瞭性とトーンの正確性が著しく向上し、最小限のデータと設定で表現的で曲に似た出力を実現する。

ABSTRACT

Machine learning based singing voice models require large datasets and lengthy training times. In this work we present a lightweight architecture, based on the Differentiable Digital Signal Processing (DDSP) library, that is able to output song-like utterances conditioned only on pitch and amplitude, after twelve hours of training using small datasets of unprocessed audio. The results are promising, as both the melody and the singer's voice are recognizable. In addition, we present two zero-configuration tools to train new models and experiment with them. Currently we are exploring the latent space representation, which is included in the DDSP library, but not in the original DDSP examples. Our results indicate that the latent space improves both the identification of the singer as well as the comprehension of the lyrics. Our code is available at https://github.com/juanalonso/DDSP-singing-experiments with links to the zero-configuration notebooks, and our sound examples are at https://juanalonso.github.io/DDSP-singing-experiments/ .

研究の動機と目的

  • 最小限のデータと学習時間で、DDSPを用いた軽量で効率的なボーカル合成モデルを開発すること。
  • 潜在空間表現の導入がボーカルの明瞭性とトーンの正確性に与える影響を調査すること。
  • 機械学習の専門知識がほとんど不要な、アクセスしやすいゼロ設定のツールを提供し、ボーカルモデルの学習と実験を容易にすること。
  • DDSPが単音楽器の範囲を越えて、人間のボーカルの表現的で複雑な性質を効果的にモデル化できることを示すこと。

提案手法

  • モデルはDDSPライブラリを用いて、f0とラウドネスから音声を再構築し、微分可能フレームワーク内で調波型と減算型のシンセサイザーを組み合わせる。
  • 元の音声から抽出したMFCCを条件付けとして用いることで、潜在空間が学習され、ボーカルのトーンと音声内容の表現が向上する。
  • 生成音声とターゲット音声の周波数ドメインでの整合性を確保するため、マルチスケールスペクトログラム損失を用いてエンドツーエンドで学習する。
  • 実世界の状況(背景ノイズ、ピッチ推定の誤差など)を想定し、一般化性能と耐性を検証するために、小さな未処理音声データセットを用いる。
  • カスタムデータ前処理や複雑な設定が不要な、ゼロ設定のJupyterノートブックを提供し、ユーザーが簡単にモデルの学習と推論が行えるようにする。
  • オシレーター、フィルター、エンvelopeといった微分可能DSPコンponentsを活用することで、学習中の勾配伝搬と解釈可能性を確保する。

実験結果

リサーチクエスチョン

  • RQ1ピッチとアモニチュードの条件付けのみで、表現的でヴォーカリスト識別可能なボーカルを生成できる軽量なDDSPベースのモデルは構築可能か?
  • RQ2MFCCから導出された潜在空間表現を組み込むことで、ボーカルの明瞭性とトーン品質はどのように向上するか?
  • RQ3最小限のデータと前処理なしで、DDSPは表現的で複雑なボーカル信号にどの程度一般化できるか?
  • RQ4ゼロ設定ツールは、非専門家がDDSPを用いてボーカル合成を実験する際の障壁を顕著に低減できるか?

主な発見

  • わずかな未処理データセットを12時間学習した後でも、モデルは元のヴォーカリストに属すると認識されるような曲に似た発話出力を生成する。
  • MFCCから導出された潜在空間表現の導入により、ピッチとアモニチュードのみの条件付けに比べ、歌詞の理解度とボーカルトーンの正確性が顕著に向上する。
  • 大規模データセットや広範な前処理を必要とせず、高品質なボーカル合成を実現しており、背景ノイズやピッチ推定誤差に対しても耐性があることが示された。
  • ゼロ設定のノートブックにより、最小限のセットアップでモデルの学習と推論が可能となり、SMCコミュニティにおける実験と採用が加速された。
  • 結果から、DDSPがボーカル合成に適しており、バイブラート、ダイナミクス、発音の表現といった表現的特徴の拡張にも対応可能であることが確認された。
  • 著者らは、既存のDDSPモデル(例:フルート、バイオリン)との互換性を示し、訓練済みコンponentsの相互運用性と再利用性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。