Skip to main content
QUICK REVIEW

[論文レビュー] Improving DNN-based Music Source Separation using Phase Features

Joachim Muth, Stefan Uhlich|arXiv (Cornell University)|Jul 7, 2018
Speech and Audio Processing参考文献 13被引用数 12
ひとこと要約

本稿では、短時間フーリエ変換(STFT)からの振幅および位相特徴を統合的に活用することで、音楽ソース分離性能を向上させる新しい深層ニューラルネットワーク(DNN)アーキテクチャを提案する。位相の原始的入力の代わりに、STFT位相の時間的・周波数的微分を入力特徴として用い、振幅と位相の処理を別々に扱う二重ブランチネットワークを採用することで、DSD100データセット上でベース楽器の信号対歪み比(SDR)に6.17%の相対的改善が達成され、全楽器で一貫した性能向上が得られた。

ABSTRACT

Music source separation with deep neural networks typically relies only on amplitude features. In this paper we show that additional phase features can improve the separation performance. Using the theoretical relationship between STFT phase and amplitude, we conjecture that derivatives of the phase are a good feature representation opposed to the raw phase. We verify this conjecture experimentally and propose a new DNN architecture which combines amplitude and phase. This joint approach achieves a better signal-to distortion ratio on the DSD100 dataset for all instruments compared to a network that uses only amplitude features. Especially, the bass instrument benefits from the phase information.

研究の動機と目的

  • STFTにおける位相情報が、振幅のみを用いるモデルを上回る深層学習ベースの音楽ソース分離に寄与するかどうかを調査すること。
  • DNN性能を向上させる有効な位相表現を同定し、原始的位相入力にとどまらないこと。
  • 振幅に偏らないよう、振幅と位相特徴を効果的に統合するニューラルネットワークアーキテクチャを設計すること。
  • 提案手法をDSD100ベンチマークデータセットで検証し、楽器ごとの性能向上を定量的に評価すること。

提案手法

  • 著者らは、理論的関係に基づき、インスタントeneイズ周波数(時間微分)および群速度遅延(周波数微分)として知られる、STFT位相の時間的・周波数的微分を位相特徴として用いる。
  • 離散的STFTによって生じる系統的位相シフトを補正する前処理ステップを導入し、特徴の整合性とネットワーク学習効率を向上させる。
  • 二重ブランチDNNアーキテクチャを提案:一方のブランチは振幅特徴を処理し、他方のブランチは前処理済みの位相微分を処理する。両ブランチとも500ユニットの全結合層を2層用いる。
  • 二つのブランチの出力を連結し、ReLU活性化関数を用いた最終的な全結合層に通して、ターゲット楽器の振幅を予測する。
  • 学習中に周波数チャンネルごとのバッチ単位の平均および標準偏差を用いて特徴正規化を実施し、5フレームの時間的コンテキストを保持する。
  • 平均二乗誤差損失関数を用いてエンドツーエンドでネットワークを学習させ、推定された振幅と混合信号の位相から逆STFTを用いて時間領域信号を再構築する。

実験結果

リサーチクエスチョン

  • RQ1STFTからの位相特徴は、振幅のみを用いるモデルを上回るDNNベースの音楽ソース分離に寄与するか?
  • RQ2原始的STFT位相はDNNの入力として適切か、それとも導出された位相表現(例:微分)がより優れた性能をもたらすか?
  • RQ3振幅と位相特徴をDNNで効果的に統合するにはどうすればよいか?特に、振幅が優位にならずに位相が意味的に寄与するようにするには?
  • RQ4離散的STFTに起因する位相シフトの補正が、モデル性能にどのような影響を及えるか?
  • RQ5提案手法は、DSD100ベンチマーク上で、異なる楽器における信号対歪み比(SDR)に測定可能な向上をもたらすか?

主な発見

  • STFT位相の時間的・周波数的微分を特徴として用いることで、学習効率が著しく低いとされる原始的位相入力よりもDNN性能が顕著に向上する。
  • 提案された二重ブランチネットワークアーキテクチャは、振幅と位相特徴を効果的に統合し、ネットワークが位相情報を無視するのを防いでいる。
  • 離散的STFTに起因する位相シフトの補正により、より一貫性があり学習可能な位相表現が得られ、モデル性能が向上した。
  • DSD100テストセットにおいて、提案手法はベース楽器で0.2 dBのSDR向上(3.44 dB 対 3.24 dB)を達成し、振幅のみのベースラインに対して6.17%の相対的改善を示した。
  • 全楽器で測定可能なSDR向上が得られた:ドラムで+0.03 dB(+0.64%)、その他の楽器で+0.11 dB(+3.11%)、ボーカルで+0.04 dB(+0.84%)、全体的に一貫した改善が確認された。
  • 知覚的評価では、改善された分離が、特にベース楽器において明瞭で明確な楽器分離をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。