Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end Microphone Permutation and Number Invariant Multi-channel Speech Separation

Yi Luo, Zhuo Chen|arXiv (Cornell University)|Oct 30, 2019
Speech and Audio Processing参考文献 24被引用数 7
ひとこと要約

本稿では、マイクの順列および数に依存しないエンド・ツー・エンドのモジュールであるTransform-Average-Concatenate (TAC) を提案する。TAC は、共有された特徴変換、チャネル別平均化、および個々のチャネル特徴との連結を用いて、グローバルで順列不変な処理を可能にすることで、FaSNet を強化し、マイク数やアレイ構成が異なる状況下でも分離性能を顕著に向上させる。このアーキテクチャは、アドホックおよび固定ジオメトリの両方の設定において有効である。

ABSTRACT

An important problem in ad-hoc microphone speech separation is how to guarantee the robustness of a system with respect to the locations and numbers of microphones. The former requires the system to be invariant to different indexing of the microphones with the same locations, while the latter requires the system to be able to process inputs with varying dimensions. Conventional optimization-based beamforming techniques satisfy these requirements by definition, while for deep learning-based end-to-end systems those constraints are not fully addressed. In this paper, we propose transform-average-concatenate (TAC), a simple design paradigm for channel permutation and number invariant multi-channel speech separation. Based on the filter-and-sum network (FaSNet), a recently proposed end-to-end time-domain beamforming system, we show how TAC significantly improves the separation performance across various numbers of microphones in noisy reverberant separation tasks with ad-hoc arrays. Moreover, we show that TAC also significantly improves the separation performance with fixed geometry array configuration, further proving the effectiveness of the proposed paradigm in the general problem of multi-microphone speech separation.

研究の動機と目的

  • マイクの配置や数が変化する状況において、ディープラーニングベースのエンド・ツー・エンドのマルチチャネル音声分離システムのロバスト性の欠如に対処すること。
  • マイクの順列に敏感で、固定された入力次元を必要とする既存のエンド・ツー・エンドビームフォーマーの制限を克服すること。
  • すべての利用可能なマイク信号を用いてグローバルで順列不変な処理を可能にする、シンプルでモジュラーなコンponents を設計すること。
  • アドホック(固定されていない)および固定ジオメトリのマイクアレイ構成の両方で性能を向上させること。

提案手法

  • TAC は各マイクの特徴を共有された変換サブモジュールで処理し、チャネル間でパラメータを共有する。
  • 変換された特徴をチャネル間で平均化して、グローバルで順列不変な表現を形成する。
  • この平均化された表現は、2番目のサブモジュールを通じてグローバルなコンテキストを学習した後、個々のチャネルの変換済み特徴と連結される。
  • 連結された特徴は、3番目のサブモジュールを通過し、チャネル固有の出力を生成する。これにより、ローカルな意思決定を保ちつつグローバルコンテキストを維持できる。
  • このアーキテクチャは FaSNet フレームワークにスムーズに統合され、エンド・ツー・エンドで順列および数に依存しない学習を可能にするために、処理ブロックを置き換えたり強化したりする。
  • 平均化処理と共有パラメータのおかげで、マイクのインデックス順序や入力次元の変化に対して不変である。

実験結果

リサーチクエスチョン

  • RQ1シンプルでエンド・ツー・エンドのモジュールが、マルチチャネル音声分離においてマイクの順列や数の変動に対してロバスト性を向上させられるか?
  • RQ2TAC は、マイクの幾何配置や数が不明なアドホックマイクアレイ構成において、FaSNet の性能をどのように向上させるか?
  • RQ3TAC は固定ジオメトリのアレイ構成でも性能向上をもたらすか?
  • RQ4フィルタ推定における不良な事前分離または限られた周波数分解能が引き起こす性能低下を TAC は緩和できるか?
  • RQ5TAC は、ビームフォーミングフィルタ推定において、すべてのマイクからのグローバル情報のより良い活用をどの程度可能にするか?

主な発見

  • TAC は、アドホックアレイ構成下でマイク数が2、4、6のすべての状況において分離性能を顕著に向上させ、特に重なりが大きい状況で最大の向上が見られた。
  • TAC を搭載した単一段階の FaSNet は、元の二段階 FaSNet もしくは TasNet ベースのモデルを上回る性能を示し、事前分離段階がなくても優れた性能を達成した。
  • TAC はマイク数の増加に対しても安定した性能を示し、標準的なモデルが見せる性能の低下を防ぐ。
  • 固定ジオメトリのアレイでは、TAC が元の FaSNet よりも性能を向上させ、アドホック設定を超えた有効性を示した。
  • TAC を用いることで、4 ms という小さなウィンドウサイズでも性能の損なわれない運用が可能となり、周波数分解能の低下に対してもロバストであることが示された。
  • TasNet における特徴連結が性能低下を引き起こす場合でも、TAC はグローバル特徴統合の面で優位性を示しており、その利点が顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。