Skip to main content
QUICK REVIEW

[論文レビュー] Neural Speech Separation Using Spatially Distributed Microphones

Dongmei Wang, Zhuo Chen|arXiv (Cornell University)|Apr 28, 2020
Speech and Audio Processing参考文献 24被引用数 5
ひとこと要約

本論文は、マイクの数や配置に依存しない空間的に分散したマイク向けのニューラル音声分離手法を提案する。インタ leave された自己注意(チャネル間処理用)と双方向LSTM(時間的モデリング用)の層を交互に配置し、その後グローバル平均プーリングを適用して時周波数マスクを推定することで、ベースラインと比較して遠距離音声認識において顕著なWER低減を達成した。

ABSTRACT

This paper proposes a neural network based speech separation method using spatially distributed microphones. Unlike with traditional microphone array settings, neither the number of microphones nor their spatial arrangement is known in advance, which hinders the use of conventional multi-channel speech separation neural networks based on fixed size input. To overcome this, a novel network architecture is proposed that interleaves inter-channel processing layers and temporal processing layers. The inter-channel processing layers apply a self-attention mechanism along the channel dimension to exploit the information obtained with a varying number of microphones. The temporal processing layers are based on a bidirectional long short term memory (BLSTM) model and applied to each channel independently. The proposed network leverages information across time and space by stacking these two kinds of layers alternately. Our network estimates time-frequency (TF) masks for each speaker, which are then used to generate enhanced speech signals either with TF masking or beamforming. Speech recognition experimental results show that the proposed method significantly outperforms baseline multi-channel speech separation systems.

研究の動機と目的

  • マイクの数や空間的配置が不明で変動するアドホックマイクアレイにおけるマルチチャネル音声分離の課題に対処すること。
  • 既知の幾何構造と固定入力サイズに依存する固定アレイニューラルネットワークの限界を克服すること。
  • マイク数、順序、空間的配置に対して不変である一方で、空間的および時間的相関を活用するモデルを開発すること。
  • スマートフォンなどの分散デバイスからの実世界録音における自動音声認識(ASR)性能の向上を図ること。
  • 時周波数マスキングとMVDR beamformingを用いた重なり音声分離の有効性を実証すること。

提案手法

  • チャネル間処理と時間的処理層を交互に配置する新しい空間的・時間的処理ブロックを採用する。
  • 可変数のマイクに対して、チャネル次元に沿ってマルチヘッドドット積分の自己注意を適用し、空間的情報を統合する。
  • チャネルごとの出力に対して、インタ leave された処理後に双方向LSTM(BLSTM)層を用いて時間的モデリングを行う。
  • 複数の空間的・時間的ブロックをスタックすることで、段階的に結合された空間的・時間的依存関係を捉える。
  • 最終ブロックの後、チャネル全体にわたるグローバル平均プーリングを適用し、マルチチャネル情報の統合を図り、マスク推定に用いる。
  • 各話者のための時周波数マスクを推定し、これによりTFマスキングまたはMVDRビームフォーミングを実行して強化音声を生成する。
Figure 1: Block diagram of proposed model.
Figure 1: Block diagram of proposed model.

実験結果

リサーチクエスチョン

  • RQ1アドホックマイクアレイにおいて、マイク数や配置が不明で変動する状況でも、ニューラルネットワークが頑健な音声分離を達成できるか。
  • RQ2時間的処理を逐次的に行うのではなく、インタ leave されたチャネル間処理と時間的処理が、マルチチャネル音声信号のモデリングにおいて優れているか。
  • RQ3実世界の分散マイク環境下で、提案手法がベースラインシステムと比較してASR性能にどの程度優れているか。
  • RQ4MVDRビームフォーミングにおける誤った基準チャネル選択に対して、モデルの耐性はどの程度高いか。
  • RQ5提案アーキテクチャを用いた場合、分散マイクの数を増やすことで、一貫して分離性能が向上するか。

主な発見

  • 提案手法はMVDRビームフォーミングを用いて16.11%のWERを達成し、マルチストリームベースライン(24.18%)および関係特徴ベースライン(21.63%)を顕著に上回った。
  • TFマスキングを用いた場合、提案手法のWERは17.75%に低下したが、マルチストリームベースラインは28.66%に留まった。
  • 提案手法は、チャネル選択エラーに対してマルチストリームベースラインよりもはるかに感受性が低く、後者ではオラクル状態(21.68%)からランダム選択(30.66%)に至るまでWERが急増したが、提案手法は16.71%から17.85%に僅かに上昇した。
  • 提案手法の性能は、入力マイク数の増加に伴い一貫して向上したが、マルチストリームベースラインは4マイクを越えてはほとんど改善が見られなかった。
  • アブレーションスタディの結果、インタ leave 構造を削除するとWERが20.89%(MVDR)に低下し、空間的および時間的モデリングの交互処理の重要性が示された。
  • モデルはマイク数および順序の変更に対して頑健であり、マイク数や順序が変化しても性能に劣化が生じなかった。
Figure 2: %WERs for different channel numbers.
Figure 2: %WERs for different channel numbers.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。