Skip to main content
QUICK REVIEW

[論文レビュー] Divide and Conquer: A Deep CASA Approach to Talker-independent Monaural Speaker Separation

Yuzhou Liu, DeLiang Wang|arXiv (Cornell University)|Apr 25, 2019
Speech and Audio Processing参考文献 40被引用数 5
ひとこと要約

本稿では、話者に依存しないモノラル音声分離のための深層CASAsフレームワークを提案する。この手法は、2段階のアプローチでタスクを分割する:パーミュテーション不変訓練によるフレームレベルのスペクトル分離、およびクラスタリングによるフレームレベルの話者追跡。コンactなモデルでWSJ0-2mixデータセットにおいて最先端の性能を達成し、計算複雑性を低減しながらSDR、SI-SNR、PESQ、ESTOIの各指標で先行手法を上回った。

ABSTRACT

We address talker-independent monaural speaker separation from the perspectives of deep learning and computational auditory scene analysis (CASA). Specifically, we decompose the multi-speaker separation task into the stages of simultaneous grouping and sequential grouping. Simultaneous grouping is first performed in each time frame by separating the spectra of different speakers with a permutation-invariantly trained neural network. In the second stage, the frame-level separated spectra are sequentially grouped to different speakers by a clustering network. The proposed deep CASA approach optimizes frame-level separation and speaker tracking in turn, and produces excellent results for both objectives. Experimental results on the benchmark WSJ0-2mix database show that the new approach achieves the state-of-the-art results with a modest model size.

研究の動機と目的

  • 未観測の話者に一般化できる話者に依存しないモノラル音声分離の課題に対処すること。
  • uPIT(同性別混合音声における話者追跡の劣化)やDC(フレームレベルの分離が最適でない)といった既存手法の限界を克服し、両者の長所を統合すること。
  • 計算聴覚シーン解析(CASA)にインspiredされた2段階の深層学習フレームワークにより、フレームレベルの分離と長期的な話者追跡の両方を向上させること。
  • 時間周波数ユニットレベルではなくフレームレベルで処理することで、ディープクラスタリングと比較して計算複雑性を低減すること。

提案手法

  • 本手法は2段階のアプローチを採用する:まず、パーミュテーション不変ニューラルネットワークを用いて、各時間フレームにおける話者スペクトルを同時にグループ化して分離する。
  • 次に、時間的特徴を捉えるために、学習済みの埋め込みに基づいてフレームレベルのスペクトル推定値を個別の話者に割り当てるクラスタリングネットワークを用いて逐次的グループ化を行う。
  • スペクトル再構成の精度を高め、出力における位相歪みを低減するために、複素比マスクを適用する。
  • スペクトル推定には周波数マッピング層を備えたDense-UNetを、時間的モデリングにはドロップドライレイヤーを備えたTCNを採用する。
  • SNRと重み付きクラスタリングの目的関数を用いて、両ステージを同時に最適化することで、アライメントと一貫性を向上させる。
  • 話者追跡はフレームレベルの埋め込みに対してK-meansクラスタリングを適用することで実現し、DCにおけるO(FT)からO(T)に計算複雑性を低減する。

実験結果

リサーチクエスチョン

  • RQ1フレームレベルの分離とフレームレベルの話者追跡を組み合わせた2段階の深層学習フレームワークは、話者に依存しないモノラル音声分離において、既存の最先端手法を上回ることができるか?
  • RQ2同時的グループ化と逐次的グループ化の共同最適化は、フレームレベルの分離と話者追跡の両性能をどのように向上させるか?
  • RQ3時間周波数ユニットレベルのクラスタリングと比較して、フレームレベルのクラスタリングアプローチは計算複雑性を低減できるか?
  • RQ4提案手法は、SDRおよびSI-SNRの観点から、理想マスク(例:IRM、PSM)を上回る性能を達成できるか?
  • RQ5特に同性別混合音声において、uPIT や DC と比較して、モデルの一般化性能はどのように向上するか?

主な発見

  • 深層CASAsシステムはWSJ0-2mixベンチマークで最先端の性能を達成し、最高の報告済みuPIT手法よりもSDRで0.1 dBの向上を達成した。
  • 本手法は、比較対象のすべての手法の中で最高のSI-SNRおよびESTOIスコアを達成しており、優れた音声品質と聞き取りやすさを示している。
  • PESQスコアは最高性能を示したFurcaNeXtよりわずかに低いが、依然として競争力があり、良好な知覚的品質を示している。
  • パラメータ数が著しく少なく(TasNet や FurcaNeXt よりもはるかに小さい)、高い効率性を示している。
  • 共同最適化により、すべての指標がわずかに向上(SDRでΔ0.1 dB、PESQでΔ0.02、ESTOIでΔ0.3%)し、エンドツーエンド学習の利点が示された。
  • 学習済み表現が理想化された仮定を上回ることを示しており、本手法は理想マスク(IRM、PSM)をSDRおよびSI-SNRの観点で上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。