Skip to main content
QUICK REVIEW

[論文レビュー] Cracking the cocktail party problem by multi-beam deep attractor network

Zhuo Chen, Jinyu Li|arXiv (Cornell University)|Mar 29, 2018
Speech and Audio Processing参考文献 33被引用数 3
ひとこと要約

本稿では、最初に固定された微分ビームフォーマーを多チャネル入力に適用し、その後各ビームに対して単一チャネルアンカードディープアトラクターネットを用い、最適なビーム選択を経て、マルチトークザー音声分離を向上させるマルチビームディープアトラクターネット(MBDAN)を提案する。この手法は、4人話者の場合に11.5 dB、3人話者の場合に11.76 dB、2人話者の場合に11.02 dBのSDR向上を達成し、オラクルMVDRビームフォーマーと同等の性能を示す。

ABSTRACT

While recent progresses in neural network approaches to single-channel speech separation, or more generally the cocktail party problem, achieved significant improvement, their performance for complex mixtures is still not satisfactory. In this work, we propose a novel multi-channel framework for multi-talker separation. In the proposed model, an input multi-channel mixture signal is firstly converted to a set of beamformed signals using fixed beam patterns. For this beamforming, we propose to use differential beamformers as they are more suitable for speech separation. Then each beamformed signal is fed into a single-channel anchored deep attractor network to generate separated signals. And the final separation is acquired by post selecting the separating output for each beams. To evaluate the proposed system, we create a challenging dataset comprising mixtures of 2, 3 or 4 speakers. Our results show that the proposed system largely improves the state of the art in speech separation, achieving 11.5 dB, 11.76 dB and 11.02 dB average signal-to-distortion ratio improvement for 4, 3 and 2 overlapped speaker mixtures, which is comparable to the performance of a minimum variance distortionless response beamformer that uses oracle location, source, and noise information. We also run speech recognition with a clean trained acoustic model on the separated speech, achieving relative word error rate (WER) reduction of 45.76\%, 59.40\% and 62.80\% on fully overlapped speech of 4, 3 and 2 speakers, respectively. With a far talk acoustic model, the WER is further reduced.

研究の動機と目的

  • 複雑で重度に重なったマルチトークザー状況、特に4人以上の話者がいる状況における単一チャネル音声分離の限界を克服すること。
  • 空間的情報(ビームフォーミング)とスペクトル的情報(ディープアトラクター)を統合し、分離性能を向上させること。
  • 可変な話者数に対応可能で、混响やノイズに強く、エンドツーエンド互換性を持つシステムを構築すること。
  • マルチチャネルビームフォーミングに続いて単一チャネル分離を適用することで、オラクル空間的情報を用いるシステムと同等またはそれを上回る性能を達成できることを示すこと。

提案手法

  • 入力の多チャネル音声混合信号を、空間的・スペクトル的不一致に対してより頑健な固定微分ビームフォーマーを用いて複数のビームフォーマード信号に変換する。
  • 各ビームフォーマード信号を独立して処理する単一チャネルアンカードディープアトラクターネット(DAN)を用い、話者固有の埋め込みを学習することで音源を分離する。
  • 最終的な分離出力は、各話者に対して信号対歪み比(SDR)が最大となるビームを選択することで後処理的に得られ、順序の不確実性(パーミュテーションアンビギュイティ)を回避する。
  • 分離品質のエンドツーエンド最適化を可能とするために、埋め込みに対する教師あり損失とSDRに基づくビーム選択を組み合わせて学習を行う。
  • 現実的で困難な条件下での性能評価を目的として、2人、3人、4人話者混合音声からなる新規データセットを構築した。

実験結果

リサーチクエスチョン

  • RQ1多チャネルビームフォーミングと単一チャネルディープアトラクターネットを組み合わせることで、複雑なマルチトークザー音声分離において顕著な性能向上が達成できるか?
  • RQ2本稿で提案するMBDANシステムは、オラクル空間的情報を用いるシステムと比較して、SDRおよび語誤り率(WER)の観点でどの程度の性能を示すか?
  • RQ3ビームフォーミングステップが、重度に重なった混合音声における混響およびスペクトルマスキングの影響をどの程度軽減できるか?
  • RQ4本手法は、話者位置やクリアな信号の情報が事前に分かっていない状況でも、オラクルビームフォーマーと同等の性能を達成できるか?

主な発見

  • 提案されたMBDANシステムは、4人話者混合音声で11.5 dB、3人話者で11.76 dB、2人話者で11.02 dBのSDR向上を達成し、従来の単一チャネル手法を著しく上回る。
  • システムの性能は、話者位置、ノイズ、音声情報がオラクルで与えられた最小分散歪みなし応答(MVDR)ビームフォーマーと同等である。
  • クリアな音声モデルで学習した音声認識では、4人話者混合音声で相対的に62.80%のWER低減、3人話者で59.40%、2人話者で45.76%の低減が達成された。
  • 遠方音響モデルを用いることで、それぞれ69.51%、64.19%、52.53%のWER低減が達成され、混響やノイズにさらなる耐性が向上した。
  • 強力な話者と弱い話者との間で4 dBの性能差が生じており、支配的である話者に対する分離能力が優れていることが示された。
  • 特に混響環境下でも、ビームフォーミングによるスペクトルマスキングの低減のおかげで、単一チャネルディープアトラクターネットを上回る顕著な性能向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。