Skip to main content
QUICK REVIEW

[論文レビュー] CWS-PResUNet: Music Source Separation with Channel-wise Subband Phase-aware ResUNet

Haohe Liu, Qiuqiang Kong|arXiv (Cornell University)|Dec 9, 2021
Speech and Audio Processing被引用数 13
ひとこと要約

この論文では、チャネルワイズサブバンド(CWS)特徴量と複素数的理想比マスク(cIRM)推定を用いてボーカル分離性能を向上させる、CWS-PResUNetと呼ばれる新しい音楽ソース分離モデルを提案する。マグニチュードと位相の推定を分離し、グローバルな重み共有を低減することで、MUSDB18HQテストセットにおけるボーカル分離でSOTAのSDR 8.92を達成し、Demucs や X-UMX といった先行手法を上回る性能を発揮した。

ABSTRACT

Music source separation (MSS) shows active progress with deep learning models in recent years. Many MSS models perform separations on spectrograms by estimating bounded ratio masks and reusing the phases of the mixture. When using convolutional neural networks (CNN), weights are usually shared within a spectrogram during convolution regardless of the different patterns between frequency bands. In this study, we propose a new MSS model, channel-wise subband phase-aware ResUNet (CWS-PResUNet), to decompose signals into subbands and estimate an unbound complex ideal ratio mask (cIRM) for each source. CWS-PResUNet utilizes a channel-wise subband (CWS) feature to limit unnecessary global weights sharing on the spectrogram and reduce computational resource consumptions. The saved computational cost and memory can in turn allow for a larger architecture. On the MUSDB18HQ test set, we propose a 276-layer CWS-PResUNet and achieve state-of-the-art (SoTA) performance on vocals with an 8.92 signal-to-distortion ratio (SDR) score. By combining CWS-PResUNet and Demucs, our ByteMSS system ranks the 2nd on vocals score and 5th on average score in the 2021 ISMIR Music Demixing (MDX) Challenge limited training data track (leaderboard A). Our code and pre-trained models are publicly available at: https://github.com/haoheliu/2021-ISMIR-MSS-Challenge-CWS-PResUNet

研究の動機と目的

  • 周波数帯域全体にわたる重み共有を採用する従来のスペクトログラムベースのモデルの制限を解消すること。
  • チャネルワイズサブバンド特徴量を活用することで、計算コストを低減し周波数分解能を向上させることで、ソース分離性能を向上させること。
  • マグニチュードと位相の変動を同時に予測することで、無制限の複素数的理想比マスク(cIRM)推定を可能にすること。
  • 2021年 ISMIR MDX チャレンジにおいて、特にボーカル分離の分野でSOTAの性能を達成すること。

提案手法

  • 入力信号を均一なフィルターバンクを用いて4つのサブバンドに分解するチャネルワイズサブバンド(CWS)特徴抽出手法を採用し、周波数次元を低減するとともにチャネル数を増加させる。
  • CWSスペクトログラムは、位相に配慮したResUNetによって処理され、4つの出力を生成する:マスクのマグニチュード、位相変動の実部と虚部、および直接的なマグニチュード予測。
  • 複素数スペクトログラムは以下の式で再構成される:$\hat{S}^\prime = \text{relu}(|X^\prime| \odot \text{sigmoid}(\hat{M}) + \hat{Q}) \exp^{j(\angle X^\prime + \angle\hat{\theta})}$、ここで$\angle\hat{\theta}$は$\hat{P}_r$ と $\hat{P}_i$ から導出される。
  • 位相の再利用を避けるために、位相変動を明示的に推定することで、無制限のcIRM推定が可能になり、再構成の忠実度が向上する。
  • サブバンド再構成は、合成フィルタを用いてサブバンド出力から最終的なソース信号を回復することで実施される。
  • CWS入力による計算コストの低減のおかげで、深層ネットワーク(例:276層モデル)を構築可能となり、リソース使用量を増大させることなく高容量化が実現できる。

実験結果

リサーチクエスチョン

  • RQ1フルバンドスペクトログラムと比較して、チャネルワイズサブバンド特徴量は、音楽ソース分離モデルの効率性と性能を向上させることができるか?
  • RQ2学習された位相変動成分による明示的な位相推定は、位相の再利用に比べて、より優れた分離性能をもたらすか?
  • RQ3CWS特徴量のおかげで計算コストが低減されるため、より深いResUNetアーキテクチャを効果的に訓練できるか?
  • RQ4制限付きマスク推定と比較して、提案されたcIRM推定戦略はSDRおよび聴取的品質の面で優れているか?
  • RQ5Demucs などの時間領域モデルとCWS-PResUNetを統合することで、全体の分離性能がさらに向上するか?

主な発見

  • CWS-PResUNetは、MUSDB18HQテストセットのボーカルトラックでSOTAの信号対歪み比(SDR)8.92を達成した。
  • X-UMX、D3Net、Demucs といったベースラインモデルをボーカルおよび他の音源において上回り、他の音源のSDRは5.84を記録した。
  • CWS-PResUNetとDemucsを統合したByteMSSシステムは、2021年 ISMIR MDX チャレンジ(限定トレーニングデータトラック)でボーカル分野で2位、平均SDRで5位を達成した。
  • 設計されたフィルタバンクを用いたサブバンド再構成は、無視できるほどの再構成誤差にとどまり、サブバンド数が増加する(2、4、8サブバンド)に従って誤差が増加する傾向を示した。
  • CWS特徴量が計算コストとメモリ使用量を低減し、効率を損なわずに大規模なアーキテクチャの実現を可能にしたことが示された。
  • CWS-PResUNetと時間領域モデル(例:Demucs)との間のベースおよびドラム分離性能の差は、時間領域モデリングが打撃的で帯域制限のある音源に対してより効果的である可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。