Skip to main content
QUICK REVIEW

[論文レビュー] Learning a Joint Embedding Space of Monophonic and Mixed Music Signals for Singing Voice

Kyungyun Lee, Juhan Nam|arXiv (Cornell University)|Jun 26, 2019
Speech and Audio Processing参考文献 29被引用数 8
ひとこと要約

本稿では、音楽ミックスパイプラインを用いて生成された合成データセット上でメトリクス学習を採用することで、モノフォニック音楽トラックとミックス音楽トラックの間で共有表現を学ぶ共同埋め込みモデルを提案する。この手法により、ボーカル分離を必要とせず、ドメイン間の歌手検索が有効に可能となり、ドメイン内およびドメイン間の両タスクで優れた性能を達成する。CROSSモデルはドメイン特化型のベースラインを上回る性能を示した。

ABSTRACT

Previous approaches in singer identification have used one of monophonic vocal tracks or mixed tracks containing multiple instruments, leaving a semantic gap between these two domains of audio. In this paper, we present a system to learn a joint embedding space of monophonic and mixed tracks for singing voice. We use a metric learning method, which ensures that tracks from both domains of the same singer are mapped closer to each other than those of different singers. We train the system on a large synthetic dataset generated by music mashup to reflect real-world music recordings. Our approach opens up new possibilities for cross-domain tasks, e.g., given a monophonic track of a singer as a query, retrieving mixed tracks sung by the same singer from the database. Also, it requires no additional vocal enhancement steps such as source separation. We show the effectiveness of our system for singer identification and query-by-singer in both the same-domain and cross-domain tasks.

研究の動機と目的

  • モノフォニックおよびミックス音楽信号の間の意味的ギャップを解消すること。
  • モノフォニックおよびミックス音声ドメイン間で歌手関連情報を効果的に転送できること。
  • 同じ歌手のトラックがドメインにかかわらず近接する統一された埋め込み空間を構築すること。
  • ボーカル分離や音声強調処理に依存しないように、ミックス信号に直接学習すること。

提案手法

  • DAMPデータセットのモノフォニックボーカルトラックとmusdb18のバックグラウンド音楽を、音楽ミックスパイプラインを用いて組み合わせることで合成トレーニングデータを生成する。
  • 同じ歌手の距離を最小化し、異なる歌手の距離を最大化するように、メトリクス埋め込みを学習するためのシアンセイ型ニューラルネットワークアーキテクチャを採用する。
  • 同じ歌手の埋め込みが異なる歌手の埋め込みよりも近くなるように、対照的損失を用いてモデルを学習する。
  • メルスペクトログ램を入力特徴として用い、学習された埋め込み空間の可視化にt-SNEを適用する。
  • 2つのモデルを訓練する:MIXED(ドメインごとに別々の埋め込み)とCROSS(ドメイン間で共有される埋め込み空間)。
  • トラックレベルの埋め込みの平均をとることで歌手モデルを構築し、将来の改善のためのGMMやPCAの利用も検討可能である。

実験結果

リサーチクエスチョン

  • RQ1モノフォニックおよびミックス音楽信号の両方で歌手のアイデンティティを捉える統一された埋め込み空間を学習できるか?
  • RQ2合成ミックスデータセット上でメトリクス学習を実施することで、ドメイン間の歌手特定が有効に可能になるか?
  • RQ3統合モデルの性能は、ドメイン特化型モデルと比較して、ドメイン内およびドメイン間タスクでどのように異なるか?
  • RQ4ボーカル分離を必要とせず、実世界のミックス録音に対してもモデルが一般化可能か?
  • RQ5バックグラウンド音楽の影響は、歌手埋め込みの品質にどのような影響を及ぼし、信号対雑音比が変化してもモデルの耐性は保たれるか?

主な発見

  • CROSSモデルはドメイン内およびドメイン間の両方の歌手特定タスクで優れた性能を示し、ドメイン特化型のベースラインを上回った。
  • 共同埋め込み空間により、同じ歌手のモノフォニックおよびミックストラックが近接してマッピングされ、ドメイン間検索が可能となった。
  • t-SNE可視化により、CROSSモデルが同じ歌手のトラックがドメインを越えてクラスタを形成する共有表現を学習していることが確認された。
  • モデルは実世界のミックス録音に対しても良好に一般化され、信号対雑音比が変化しても耐性を保った。
  • 合成ミックスデータセットにより、手動のアノテーションやボーカル分離を必要とせず、効果的な学習が可能となった。
  • ボーカル強調処理や分離処理の必要性が排除され、実世界の応用における導入が簡素化された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。