Skip to main content
QUICK REVIEW

[論文レビュー] WildMix Dataset and Spectro-Temporal Transformer Model for Monoaural Audio Source Separation

Amir Zadeh, Tianjun Ma|arXiv (Cornell University)|Nov 21, 2019
Speech and Audio Processing参考文献 23被引用数 6
ひとこと要約

本稿では、25種類の音声クラスと複雑で任意の混合状態を持つ、多様なモノラル音声分離データセット WildMix を紹介し、時間的および周波数的領域における長距離依存性をモデル化することでソースを分離する、Spectro-Temporal Encoder (STE) を備えた新規トランスフォーマー型モデルである Spectro-Temporal Transformer (STT) を提案する。STT は WildMix において最先端の性能を達成し、すべてのサブデータセットで従来のベースラインを顕著に上回っている。

ABSTRACT

Monoaural audio source separation is a challenging research area in machine learning. In this area, a mixture containing multiple audio sources is given, and a model is expected to disentangle the mixture into isolated atomic sources. In this paper, we first introduce a challenging new dataset for monoaural source separation called WildMix. WildMix is designed with the goal of extending the boundaries of source separation beyond what previous datasets in this area would allow. It contains diverse in-the-wild recordings from 25 different sound classes, combined with each other using arbitrary composition policies. Source separation often requires modeling long-range dependencies in both temporal and spectral domains. To this end, we introduce a novel trasnformer-based model called Spectro-Temporal Transformer (STT). STT utilizes a specialized encoder, called Spectro-Temporal Encoder (STE). STE highlights temporal and spectral components of sources within a mixture, using a self-attention mechanism. It subsequently disentangles them in a hierarchical manner. In our experiments, STT swiftly outperforms various previous baselines for monoaural source separation on the challenging WildMix dataset.

研究の動機と目的

  • 標準的なコcktailパーティー問題や音楽分離のシナリオをはるかに超える、多様で現実世界のモノラル音声分離データセットが不足しているという問題に対処すること。
  • 複雑な音声混合状態における長距離の時間的および周波数的依存性を捉えることが可能なディーブラーニングモデルの開発。
  • スペクトログラム空間における重なったソースを分離することに特化した、トランスフォーマー型アーキテクチャの設計。
  • 現実世界の聴覚的複雑性を反映する、挑戦的で多様なデータセット上でモデルの性能を評価すること。

提案手法

  • 任意の開始時刻と音量を用いて作成された、25種類の音声クラスを有する新しいデータセット WildMix を提案。
  • 時間的および周波数的次元を別々に処理しながらも統合的に扱う、特別に設計された Spectro-Temporal Encoder (STE) を備えた、トランスフォーマー型モデルである Spectro-Temporal Transformer (STT) を導入。
  • 入力スペクトログラム内での関連する周波数成分と時間的コラムを強調するために、STE で自己注意機構を採用。これにより、空間的・時間的依存性の共同モデリングが可能になる。
  • STE では、時間的モデリング用と周波数的モデリング用の二重パスアーキテクチャを採用。両パスとも畳み込み層とマルチヘッド自己注意機構を強化要因として統合。
  • 波形再構成の忠実度を向上させるために、デコーダーヘッドでマスキングを適用し、自己回帰的生成を保証。
  • モデル性能の最適化のため、1.5か月にわたり12台の Tesla V100 GPU を用いて広範なハイパーパramータサーチを実施。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー型モデルは、多様な音声クラスを有する複雑で現実世界のモノラル混合音声において、重なった音声ソースを効果的に分離できるか?
  • RQ2Spectro-Temporal Encoder (STE) の時間的および周波数的モデリングパスを別々に処理することで、標準的なトランスフォーマー・エンコーダーと比較して、ソース分離性能にどのような寄与をするか?
  • RQ3提案された STT モデルは、ソース数(2, 3, 5)やソースクラスの組み合わせ(クラス間、クラス内、ハイブリッド)の変化に対しても汎用性を示せるか?
  • RQ4STT の個々の構成要素(例:CNN、マルチヘッド正則化、マスキング)が全体の性能に果たす寄与は何か?

主な発見

  • STT は WildMix のすべてのサブデータセットで最高の性能を示し、2ソースのハイブリッドパーティションでは平均 SDR が 9.578 を達成した。
  • 完全な STT モデルは、すべてのアブレーションバリアントを上回り、特に二重パス型 STE、CNN、デコーダーにおけるマスキングといった構成要素が最適性能を発揮するために不可欠であることを示した。
  • アブレーションスタディの結果、周波数パスを削除した(tp-only)または時間パスを削除した(sp-only)場合、性能が低下することが確認され、共同モデリングの重要性が裏付けられた。
  • RNNベースのモデル(例:DRNN、SRNN)でさえも、LSTMベースのモデル(L2L や OTF)を上回る性能を示し、このタスクにおいてトランスフォーマー・アーキテクチャの優位性が明確に示された。
  • ソース数の増加に伴い性能が低下する傾向を示した(2から5に増加)が、STT はすべての設定で強力な性能を維持した。
  • クラス内パーティションは、クラス間やハイブリッドパーティションよりもわずかに困難であり、同じクラス内に属するソース同士の類似度が高いため、分離がより困難であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。