Skip to main content
QUICK REVIEW

[論文レビュー] Improved Source Counting and Separation for Monaural Mixture

Yiming Xiao, Haijian Zhang|arXiv (Cornell University)|Apr 1, 2020
Speech and Audio Processing参考文献 34被引用数 6
ひとこと要約

本論文は、時間周波数特徴抽出ネットワークにアテンションとディープアトラクターネットワークを組み合わせた、単一モデルによるモノラル音声分離の新規アプローチを提案する。この手法は、話者数が未知の場合でも、話者数の推定と個々の音源の分離を同時に実行でき、話者数の推定精度が96.7%に達し、話者数の事前知識を必要としない2人および3人話者混合音声において、最先端のSI-SNRiおよびSDRi性能を達成した。

ABSTRACT

Single-channel speech separation in time domain and frequency domain has been widely studied for voice-driven applications over the past few years. Most of previous works assume known number of speakers in advance, however, which is not easily accessible through monaural mixture in practice. In this paper, we propose a novel model of single-channel multi-speaker separation by jointly learning the time-frequency feature and the unknown number of speakers. Specifically, our model integrates the time-domain convolution encoded feature map and the frequency-domain spectrogram by attention mechanism, and the integrated features are projected into high-dimensional embedding vectors which are then clustered with deep attractor network to modify the encoded feature. Meanwhile, the number of speakers is counted by computing the Gerschgorin disks of the embedding vectors which are orthogonal for different speakers. Finally, the modified encoded feature is inverted to the sound waveform using a linear decoder. Experimental evaluation on the GRID dataset shows that the proposed method with a single model can accurately estimate the number of speakers with 96.7 % probability of success, while achieving the state-of-the-art separation results on multi-speaker mixtures in terms of scale-invariant signal-to-noise ratio improvement (SI-SNRi) and signal-to-distortion ratio improvement (SDRi).

研究の動機と目的

  • 実世界の応用において一般的に見られる話者数が未知である状況におけるモノラル音声分離の課題に対処すること。
  • 再トレーニングやアーキテクチャの変更なしに、可変な話者数を処理できる1つのディープラーニングモデルの開発。
  • アテンション機構を用いた時間領域と周波数領域の特徴統合により、分離性能の向上。
  • 高次元埋め込みの共分散行列に対するGerschgorinドメイン解析を用いて、しきい値依存のない正確な話者数推定の実現。
  • 異なる数の音源に一般化可能な堅牢なマスク推定を実現するため、ディープアトラクターネットワーク(ADANet)の統合。

提案手法

  • モデルは、1次元の時間領域波形と2次元のスペクトログラムをアテンションベースのエンコーダーで統合し、ハイブリッド時間周波数特徴マップを生成。
  • 統合された特徴は、学習可能な投影層を介して高次元埋め込みベクトルに変換され、TasNetと同様の構造を採用。
  • 埋め込みベクトルの共分散行列のGerschgorinドメインを計算することで、話者間の直交性を活用し、話者数を推定。
  • ディープアトラクターネットワーク(ADANet)を用いて、埋め込みとアトラクター間の類似度を測定し、音源固有のマスクを生成。
  • 学習可能な線形デコーダーを用いて、マスクされた特徴を波形に逆変換し、エンドツーエンドの学習を可能に。
  • 分離品質と話者数推定精度を最適化する損失関数を用いて、システム全体をエンドツーエンドで訓練。

実験結果

リサーチクエスチョン

  • RQ1事前知識なしに、モノラル混合音声における話者数を正確に推定できる1つのディープラーニングモデルは構築可能か?
  • RQ2アテンションベースの時間周波数特徴統合は、単一領域処理に比べて分離性能をどのように向上させるか?
  • RQ3埋め込み共分散行列に対するGerschgorinドメイン解析は、しきい値依存のない信頼性の高いソース数推定法を提供できるか?
  • RQ4ADANetの統合により、統一モデル内で異なる数の話者に一般化できる程度はどの程度か?
  • RQ52人および3人話者の混合データで学習させることで、より多くの話者数の状況でも性能が向上するか?

主な発見

  • 提案手法は、話者数推定の成功率が96.7%に達し、ランク推定ベースライン(80.1%精度)を顕著に上回った。
  • SI-SNRiおよびSDRi性能において最先端の改善を達成し、2人話者混合音声では従来の周波数領域手法比で4 dB以上、3人話者混合音声では6.5 dB以上の向上を示した。
  • 2人および3人話者を統合したモデルは、3人話者専用モデルを上回り、少ない話者数から学習することで、より多くの話者数への一般化が促進されることを示した。
  • エンコーダー内に統合されたアテンション機構は、特徴表現を強化し、非アテンションベースラインに比べて分離性能の向上に寄与した。
  • Gerschgorinドメインに基づく推定法は、従来のランクベース手法とは異なり、ハイパーパramータチューニング(例:しきい値選択)の必要がなく、より簡便である。
  • モデルは話者数にわたる一般化が効果的に実現されており、一貫した性能を維持しながら、可変な数の音源を処理できる1つのアーキテクチャが有効であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。