[論文レビュー] Deep Attention Fusion Feature for Speech Separation with End-to-End Post-filter Method
本稿では、波形入力と注目メカニズムを活用して残存干渉を低減することで、事前に分離された音声を向上させる、エンドツーエンドのポストフィルタ(E2EPF)を提案する。モノラル音声分離において、WSJ0-2mixデータセットでSI-SNR、SDR、PESQ、STOIについてそれぞれ64.1%、60.2%、25.6%、7.5%の相対的改善を達成し、最先端手法を上回る性能を発揮する。
In this paper, we propose an end-to-end post-filter method with deep attention fusion features for monaural speaker-independent speech separation. At first, a time-frequency domain speech separation method is applied as the pre-separation stage. The aim of pre-separation stage is to separate the mixture preliminarily. Although this stage can separate the mixture, it still contains the residual interference. In order to enhance the pre-separated speech and improve the separation performance further, the end-to-end post-filter (E2EPF) with deep attention fusion features is proposed. The E2EPF can make full use of the prior knowledge of the pre-separated speech, which contributes to speech separation. It is a fully convolutional speech separation network and uses the waveform as the input features. Firstly, the 1-D convolutional layer is utilized to extract the deep representation features for the mixture and pre-separated signals in the time domain. Secondly, to pay more attention to the outputs of the pre-separation stage, an attention module is applied to acquire deep attention fusion features, which are extracted by computing the similarity between the mixture and the pre-separated speech. These deep attention fusion features are conducive to reduce the interference and enhance the pre-separated speech. Finally, these features are sent to the post-filter to estimate each target signals. Experimental results on the WSJ0-2mix dataset show that the proposed method outperforms the state-of-the-art speech separation method. Compared with the pre-separation method, our proposed method can acquire 64.1%, 60.2%, 25.6% and 7.5% relative improvements in scale-invariant source-to-noise ratio (SI-SNR), the signal-to-distortion ratio (SDR), the perceptual evaluation of speech quality (PESQ) and the short-time objective intelligibility (STOI) measures, respectively.
研究の動機と目的
- 事前に分離された音声を、事前知識を活用して向上させることで、モノラル音声分離における残存干渉を低減する。
- 分離品質の信号空間指標と整合しない可能性がある、分離訓練目的や非教師ありクラスタリングに依存する従来手法の限界を克服する。
- 注目メカニズムを用いて、事前に分離された音声特徴と混合信号を融合することで、関連する成分に注目し、分離品質を向上させる。
- 波形を入力として使用することで、再構成における位相・振幅の不一致を解消し、振幅と位相の同時最適化を可能にする。
- 事前分離とポストフィルタを統合した完全なエンドツーエンドで学習可能なフレームワークを構築する。
提案手法
- 時間周波数ドメイン分離手法(uPIT+DEF+DL)を事前分離段階として適用し、ターゲット音声の初期推定値を生成する。
- エンドツーエンドのポストフィルタ(E2EPF)に原始波形を入力とすることで、再構成のための振幅と位相の共同最適化を可能にする。
- 1次元畳み込み層を用いて、混合信号および事前分離信号の両方から深層時系列表現を抽出する。
- 混合信号と事前分離特徴の類似度を計算する学習可能な注目モジュールを導入し、深層注目融合特徴を生成する。
- 注目融合特徴を文脈として用い、ポストフィルタが強化されたターゲット信号を推定する際に、残存干渉の低減に注目する。
- 微分可能な損失関数を用いて、E2EPFネットワーク全体をエンドツーエンドで学習させ、事前分離とポストフィルタリング段階を共同最適化可能にする。
実験結果
リサーチクエスチョン
- RQ1エンドツーエンドのポストフィルタに深層注目融合特徴を組み込むことで、モノラル音声分離における残存干渉を顕著に低減できるか?
- RQ2ポストフィルタ段階で原始波形を入力とすることで、振幅・位相の不一致を是正し、性能向上が達成できるか?
- RQ3混合信号と事前分離特徴の注目ベース融合は、標準的なポストフィルタリングと比較して、どの程度分離品質を向上させるか?
- RQ4標準ベンチマークにおいて、SI-SNR、SDR、PESQ、STOIの観点から、本手法は最先端手法と比較してどの程度優れているか?
- RQ5事前分離とポストフィルタリングを1つのエンドツーエンドフレームワークに統合することで、逐次的または独立した処理よりも優れた性能が得られるか?
主な発見
- 提案されたE2EPF手法は、WSJ0-2mixデータセットにおいて、事前分離ベースライン比でSI-SNRに64.1%の相対的改善を達成した。
- 本手法は、事前分離手法比でSDRを60.2%相対的に向上させ、信号対歪み比の顕著な向上を示した。
- PESQスコアは25.6%相対的に向上し、分離音声の主観的品質の向上を示した。
- STOIは7.5%相対的に向上し、ポストフィルタリング後の音声の聞き取りやすさの向上を示した。
- 深層注目融合特徴の追加により、注目機能なしのE2EPFと比較して明確な性能向上が得られ、残存干渉の抑制効果を確認した。
- WSJ0-3mixデータセットでも、比較対象のすべてのシステムの中で最高の性能を達成し、∆SI-SNRおよび∆SDRの正の増加を示した。これにより、マルチソース環境下でも堅牢性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。