Skip to main content
QUICK REVIEW

[論文レビュー] Content based singing voice source separation via strong conditioning using aligned phonemes

Gabriel Meseguer-Brocal, Geoffroy Peeters|arXiv (Cornell University)|Aug 5, 2020
Speech and Audio Processing参考文献 41被引用数 6
ひとこと要約

本稿では、時間的に同期された歌詞と発音記号を備えた新しいマルチモーダル・マルチトラックデータセットを紹介し、発音記号埋め込みによる強い条件付けを用いるU-Netベースの歌唱音声分離モデルを提案する。フレーム単位の発音情報で条件付けられた特徴量ごとの線形調製(FiLM)層を適用することで、最先端の性能を達成し、最も単純な強条件付け構成が、弱い条件付けやより複雑な設定を上回る結果を示した。

ABSTRACT

Informed source separation has recently gained renewed interest with the introduction of neural networks and the availability of large multitrack datasets containing both the mixture and the separated sources. These approaches use prior information about the target source to improve separation. Historically, Music Information Retrieval researchers have focused primarily on score-informed source separation, but more recent approaches explore lyrics-informed source separation. However, because of the lack of multitrack datasets with time-aligned lyrics, models use weak conditioning with non-aligned lyrics. In this paper, we present a multimodal multitrack dataset with lyrics aligned in time at the word level with phonetic information as well as explore strong conditioning using the aligned phonemes. Our model follows a U-Net architecture and takes as input both the magnitude spectrogram of a musical mixture and a matrix with aligned phonetic information. The phoneme matrix is embedded to obtain the parameters that control Feature-wise Linear Modulation (FiLM) layers. These layers condition the U-Net feature maps to adapt the separation process to the presence of different phonemes via affine transformations. We show that phoneme conditioning can be successfully applied to improve singing voice source separation.

研究の動機と目的

  • 歌唱音声分離のための、時間的に同期された歌詞と発音記号を備えたマルチトラックデータセットの不足に対処すること。
  • 非同期のテキストとは対照的に、フレーム単位で同期された発音記号を用いた強力な条件付けを活用し、分離性能を向上させること。
  • データ駆動型の深層学習フレームワークにおいて、発音記号に基づく条件付けの有効性を評価すること。
  • このタスクにおいて、単純でパラメータ効率の良い条件付け機構が、より複雑な機構を上回るかどうかを調査すること。

提案手法

  • モデルは、発音情報で特徴マップを条件づけるために、特徴量ごとの線形調製(FiLM)層を備えたU-Netアーキテクチャを採用する。
  • 発音記号の活性化は、FiLM層内のアフィン変換を制御するガンマおよびベータパラメータに埋め込まれる。
  • 入力には、混合音のスペクトログラムの振幅と、単語レベルでの時間的に同期された発音マトリクスが含まれる。
  • 発音マトリクスは、事前学習済みのASRシステムを用いた強制アラインメントから得られ、フレームレベルでの対応が保証される。
  • 予測されたボーカルソースとターゲットソースの差を最小化するようにモデルを学習する。標準的な損失関数が使用される。
  • さまざまな条件付け構成(強条件付け対弱条件付け、および基本テンソルのパrameterizationの違い)が評価される。

実験結果

リサーチクエスチョン

  • RQ1時間的に同期された発音記号を用いた強条件付けは、非同期の歌詞を用いた弱条件付けと比較して、歌唱音声分離性能を顕著に向上させるか?
  • RQ2単純でパラメータが少ない条件付け機構(例:グローバル変換)は、より複雑でパラメータが多い条件付け機構を上回るか?
  • RQ3発音記号レベルの条件付けは、特にサイレントまたは複雑なボーカルフレームにおいて、ボーカルとバックグラウンド楽器を分離する能力にどのように影響を与えるか?
  • RQ4アノテーションエラーと単語内での発音記号の重複が、強条件付けモデルの性能をどの程度妨げるか?

主な発見

  • フレーム単位の発音記号埋め込みによる強条件付けは、ベースラインU-Netおよび弱条件付けベースラインと比較して、SDR、SIR、PESスコアを顕著に向上させた。
  • 最も単純な強条件付け構成(S_s)が、他のすべての構成(190万以上の追加パラメータを有するものも含む)を上回った。
  • 480個の学習可能なパラメータのみを有するモデル(S_s)が、197万パラメータを有するモデル(S_a)を上回る性能を達成した。これは、より単純な条件付けがより良い一般化性能を示すことを示唆している。
  • アルゴリズム的アーティファクト(SAR)の低減は一貫して行われず、アーティファクトは条件付け機構の影響よりもトレーニングデータの品質に依存している可能性がある。
  • 最高のモデル(S_s)では、SDR、SIR、SARの分布がより高い値にシフトしており、データセット全体にわたりより強固で正確な分離が可能であることを示している。
  • 弱条件付けモデルは、パラメータ数に関係なく同程度の性能を示した。これは、チャンネルレベルの制御が、グローバルな発音記号ベースの条件付けよりも効果が劣ることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。