Skip to main content
QUICK REVIEW

[論文レビュー] Attention is All You Need in Speech Separation

Cem Subakan, Mirco Ravanelli|arXiv (Cornell University)|Oct 25, 2020
Speech and Audio Processing参考文献 32被引用数 10
ひとこと要約

この論文では、再帰的ネットワークを排除し、マルチスケール自己注意機構に置き換えることで、モノラル音声分離を目的としたRNNフリーのTransformerベースアーキテクチャ、SepFormerを提案する。デュアルパス処理とストライドベースのダウンサンプリングを活用することで、SOTA性能を達成した—WSJ0-2mixでは22.3 dBのSI-SNRi、WSJ0-3mixでは19.5 dBを記録—同時に完全並列処理が可能となり、RNNベースのモデルと比較して訓練時間とメモリ使用量を顕著に削減した。

ABSTRACT

Recurrent Neural Networks (RNNs) have long been the dominant architecture in sequence-to-sequence learning. RNNs, however, are inherently sequential models that do not allow parallelization of their computations. Transformers are emerging as a natural alternative to standard RNNs, replacing recurrent computations with a multi-head attention mechanism. In this paper, we propose the SepFormer, a novel RNN-free Transformer-based neural network for speech separation. The SepFormer learns short and long-term dependencies with a multi-scale approach that employs transformers. The proposed model achieves state-of-the-art (SOTA) performance on the standard WSJ0-2/3mix datasets. It reaches an SI-SNRi of 22.3 dB on WSJ0-2mix and an SI-SNRi of 19.5 dB on WSJ0-3mix. The SepFormer inherits the parallelization advantages of Transformers and achieves a competitive performance even when downsampling the encoded representation by a factor of 8. It is thus significantly faster and it is less memory-demanding than the latest speech separation systems with comparable performance.

研究の動機と目的

  • 再帰的ニューラルネットワーク(RNN)を排除することで、計算を完全に並列化可能な音声分離モデルの開発を目的とする。
  • RNNに依存せずに、標準的なWSJ0-2mixおよびWSJ0-3mixデータセットでSOTA性能を達成することを目的とする。
  • メモリ使用量と推論時間の削減により、計算効率を向上させつつ、高い分離品質を維持することを目的とする。
  • マルチスケール自己注意機構が、音声信号の短期間および長期間の依存関係をどのようにモデル化できるかを検証することを目的とする。
  • 純粋なTransformerベースアーキテクチャが、モノラルソース分離においてRNNベースのモデルを上回ることを示すこと

提案手法

  • 入力混合音声から時間周波数表現を抽出するため、完全畳み込み型エンコーダーを備えた学習可能ドメインマスキングフレームワークを採用する。
  • マスキングネットワークは、局所的およびグローバルな依存関係を別々のIntra-およびInter-Transformerブロックでモデル化するデュアルパスTransformerアーキテクチャで構成される。
  • Intra-Transformerは並列に局所的なチャンクを処理し、Inter-Transformerはチャンク間のアテンションを用いて長距離の文脈をモデル化する。両者ともマルチヘッド自己注意を用いる。
  • エンコーダーでストライド8を採用することで、系列長を短縮し、性能の著しい低下を伴わずに高速な推論を実現する。
  • 一般化性能の向上のため、動的ミキシングを適用し、デコーダーは学習済みマスクを用いたオーバーラップアド法で時間領域のソースを再構築する。
  • モデルは、SI-SNR損失を用いてエンドツーエンドで訓練され、自動混合精度とバッチサイズ1を用いて、公平な比較を実現する。

実験結果

リサーチクエスチョン

  • RQ1RNNを一切使用しない純粋なTransformerベースアーキテクチャが、モノラル音声分離においてSOTA性能を達成できるか?
  • RQ2デュアルパスフレームワークにおけるマルチスケール自己注意機構は、音声分離における長期間依存関係のモデル化において、RNNと比べてどのように異なるか?
  • RQ3エンコーディング表現を要因8でダウンサンプリングすることで、性能と効率にどの程度の影響が生じるか?
  • RQ4Transformerの並列処理能力により、RNNベースのモデルと比較して、訓練時間および推論時間の大幅な短縮が可能か?
  • RQ5動的ミキシングは、自己注意機構を用いた音声分離の文脈において、一般化性能の向上に寄与するか?

主な発見

  • SepFormerは、WSJ0-2mixデータセットでSOTAの22.3 dBのSI-SNRiを達成し、従来のRNNベースのモデルを上回った。
  • WSJ0-3mixデータセットでは、19.5 dBのSI-SNRiと19.7 dBのSDRiを記録し、新たなSOTAベンチマークを樹立した。
  • DPRNNやDPTNetと比較して、訓練がはるかに高速で、24時間未満で17 dBのSI-SNRiに到達した。一方、DPRNNは2日間を要した。
  • DPRNN、DPTNet、Wavesplitと比較して、推論が顕著に高速かつメモリ効率が良く、2600万パラメータでも同等の性能を維持した。
  • エンコーダーでストライド8を採用しても、性能が著しく低下せず、系列長の短縮と計算の高速化を実現した。
  • 動的ミキシングにより性能が向上し、RNNベースのモデルとは異なり、ダウンサンプリングの増加に対しても劣化が最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。