Skip to main content
QUICK REVIEW

[論文レビュー] Recursive speech separation for unknown number of speakers

Naoya Takahashi, Parthasaarathy Sudarsanam|arXiv (Cornell University)|Apr 5, 2019
Speech and Audio Processing参考文献 20被引用数 6
ひとこと要約

本稿では、1つのモデルで未知の数の話者を単一チャネル混合音声から分離可能な、1とrestの置換順序不変訓練(OR-PIT)を用いた再帰的音声分離手法を提案する。1回ずつ1人の話者を分離し、残差信号を再びモデルに再適用することで、2人および3人の話者混合音声において最先端の性能を達成し、再訓練なしに予期しない4人の話者混合音声にも一般化可能である。

ABSTRACT

In this paper we propose a method of single-channel speaker-independent multi-speaker speech separation for an unknown number of speakers. As opposed to previous works, in which the number of speakers is assumed to be known in advance and speech separation models are specific for the number of speakers, our proposed method can be applied to cases with different numbers of speakers using a single model by recursively separating a speaker. To make the separation model recursively applicable, we propose one-and-rest permutation invariant training (OR-PIT). Evaluation on WSJ0-2mix and WSJ0-3mix datasets show that our proposed method achieves state-of-the-art results for two- and three-speaker mixtures with a single model. Moreover, the same model can separate four-speaker mixture, which was never seen during the training. We further propose the detection of the number of speakers in a mixture during recursive separation and show that this approach can more accurately estimate the number of speakers than detection in advance by using a deep neural network based classifier.

研究の動機と目的

  • 話者数が未知または変動する状況における単一チャネルマルチスプーカー音声分離の課題に対処すること。
  • トレーニング時に観測された数を超える話者数に対しても一般化可能な統合型ディープラーニングモデルの開発。
  • 1人ずつ話者を分離する再帰的分離フレームワークの設計により、耐障害性とスケーラビリティの向上。
  • 推論時に動的に話者数を検出可能な信頼性の高い反復停止メカニズムの導入。
  • 話者数を事前に知らずに、混雑した複数話者環境における最も支配的である話者の高品質分離を可能にすること。

提案手法

  • 1人を分離し、残りの話者と置換順序不変にする新しい訓練目的である「1とrestの置換順序不変訓練(OR-PIT)」を提案。再帰的応用を可能にする。
  • 訓練済みモデルを再帰的に適用:最初に1人の話者を分離し、その後残差信号を再びモデルに供給して次の反復を実行。
  • 残差信号に音声が含まれるか否かを検出するためのバイナリ分類器(AlexNetに基づく)を用い、再帰の停止基準とする。
  • 2番目の出力チャネルからの残差信号を用いてバイナリ分類器をトレーニングし、これにより話者がもう残っていないことを検出可能にし、自動停止を実現。
  • 再帰的性質を活かして、最初に最も支配的である話者を優先的に分離することで、主要話者の全体的な分離品質を向上。
  • すべての再帰的段階で共通のモデルアーキテクチャ(Conv-TasNet-gLN)を用いることで、パラメータ効率と一般化性能を確保。

実験結果

リサーチクエスチョン

  • RQ11つのディープラーニングモデルが、トレーニング時に観測されなかった話者数を含むさまざまな話者数に対し、一般化可能か?
  • RQ2複数反復にわたって高い性能を維持できるように、再帰的分離フレームワークを効果的に訓練する方法は何か?
  • RQ3事前に話者数を知らずに、データ駆動型の信頼性の高い停止基準を開発できるか?
  • RQ4固定話者数を仮定するエンドツーエンドモデルに比べ、再帰的分離は優れているか?
  • RQ5トレーニングデータに含まれないような、10〜50人の話者混合音声に対しても、モデルは支配的話者を正しく分離できるか?

主な発見

  • 提案手法であるOR-PITを用いた再帰的アプローチは、1つのモデルでWSJ0-2mixおよびWSJ0-3mixデータセットにおいて最先端の性能を達成した。
  • トレーニング時に観測されなかった4人話者混合音声に対しても一般化可能であり、3回の再帰的反復で驚くほど高い分離品質を達成した。
  • 反復停止用のバイナリ分類器は、残差信号の音声/ノイズ検出において95.7%の精度を達成し、多クラス話者数カウント分類器(77.9%の精度)を上回った。
  • 50人の干渉話者を含む混合音声に対しても、微調整なしに、支配的話者のSI-SNRが一貫して向上した。
  • 再帰的アプローチは自然に最も支配的である話者を優先的に分離するため、最初の反復で最高品質の分離が得られ、後続の話者では徐々に品質が低下した。
  • アーキテクチャ的・トレーニング的変更なしに未知の話者数を処理できる能力は、強力な一般化性と耐障害性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。