Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Resolution Fully Convolutional Neural Networks for Monaural Audio Source Separation

Emad M. Grais, Hagen Wierstorf|arXiv (Cornell University)|Oct 28, 2017
Speech and Audio Processing参考文献 24被引用数 4
ひとこと要約

本稿では、各層で異なるサイズの複数のフィルタセットを用いて、グローバルおよびローカルな時間周波数特徴を抽出する、モノラル音声源分離のためのマルチリゾリューション完全畳み込みニューラルネットワーク(MR-FCNN)を提案する。MR-FCNNは、標準的なDNNおよびシングルリゾリューションFCNNを上回り、SDRおよびSARにおいて統計的に有意な向上を達成しており、すべてのモデル比較でp値 < 0.0025を示した。

ABSTRACT

In deep neural networks with convolutional layers, each layer typically has fixed-size/single-resolution receptive field (RF). Convolutional layers with a large RF capture global information from the input features, while layers with small RF size capture local details with high resolution from the input features. In this work, we introduce novel deep multi-resolution fully convolutional neural networks (MR-FCNN), where each layer has different RF sizes to extract multi-resolution features that capture the global and local details information from its input features. The proposed MR-FCNN is applied to separate a target audio source from a mixture of many audio sources. Experimental results show that using MR-FCNN improves the performance compared to feedforward deep neural networks (DNNs) and single resolution deep fully convolutional neural networks (FCNNs) on the audio source separation problem.

研究の動機と目的

  • 複数の重なり合う音源を含むモノラル混合信号から、ターゲット音声源を分離する課題に対処すること。
  • マルチリゾリューションの受容 field を用いて、グローバルな文脈とローカルな詳細を同時に捉えることで、音声源分離における特徴抽出を改善すること。
  • すべての層にマルチリゾリューション畳み込みフィルタを適用する、新しい深層学習アーキテクチャを構築すること。
  • マルチリゾリューション特徴学習が、シングルリゾリューションまたは全結合ネットワークと比較して分離性能を向上させることを実証すること。

提案手法

  • MR-FCNNは、各層で異なる受容 field サイズ(例:3×3、7×9、13×21)の複数のフィルタセットを並列に適用する完全畳み込み層を用いる。
  • 各フィルタセットは、異なる解像度の特徴マップを生成し、細かい局所的詳細と広範なスペクトル・時間的構造の両方を捉える。
  • ReLU活性化関数を用い、デコーダーでは逆畳み込みを適用するエンコーダ・デコーダ構造を採用し、対称的なフィルタサイズとチャネル数の設計を実施する。
  • 混合信号およびターゲット音声信号のマグニチュードスペクトログラムを用いて、エンド・トゥ・エンドで学習を実行し、Adam最適化法を用い、早期停止および学習率の段階的低下を適用する。
  • MR-FCNNのパラメータ数(558,181)は、FCNN(445,173)およびDNN(4,206,600)と同等の規模に保ち、性能比較を公正に行う。
  • 入力および出力は2次元マグニチュードスペクトログラムであり、ネットワークはマルチリゾリューション特徴学習を用いて、混合信号からターゲット源を再構築することを学習する。

実験結果

リサーチクエスチョン

  • RQ1各層にマルチリゾリューション畳み込みフィルタを適用することで、シングルリゾリューションまたは全結合ネットワークと比較して、音声源分離性能が向上するか?
  • RQ2複数のフィルタサイズによるグローバルおよびローカル特徴の同時抽出は、モノラル混合信号におけるターゲット源分離を向上させるか?
  • RQ3MR-FCNNのSDR、SIR、SAR指標は、困難な音声分離タスクにおいてDNNおよびシングルリゾリューションFCNNと比較してどのように異なるか?
  • RQ4MR-FCNNの性能向上は、複数の評価指標において統計的に有意であるか?

主な発見

  • MR-FCNNはDNNのSDR(p = 2×10⁻⁷)およびSAR(p = 9×10⁻⁷)において顕著に優れており、大きな効果量を示した。
  • MR-FCNNはシングルリゾリューションFCNNのSDR(p = 0.0025)およびSAR(p = 3×10⁻⁵)においても顕著に優れており、統計的有意性を示した。
  • 3つのモデル(DNN、FCNN、MR-FCNN)間のすべての性能差は、ボンフェローニ補正後でもp < 0.05で統計的に有意であった。
  • 入力混合信号のSDRおよびSIRが低く、分離タスクが極めて困難であることを示しており、高度な特徴学習の重要性を強調している。
  • MR-FCNNはDNNおよびFCNNよりも高いSDRおよびSARを達成しており、ターゲット源の再構築がより良く、干渉成分が低減していることを示唆している。
  • 各層で異なるフィルタサイズ(例:13×21、7×9、3×3)を用いるモデルアーキテクチャにより、すべての層で効果的なマルチリゾリューション特徴抽出が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。