Skip to main content
QUICK REVIEW

[論文レビュー] Multi-talker Speech Separation and Tracing with Permutation Invariant Training of Deep Recurrent Neural Networks.

Morten Kolbæk, Dong Yu|arXiv (Cornell University)|Mar 18, 2017
Speech and Audio Processing参考文献 27被引用数 13
ひとこと要約

この論文は、RNNを用いたエンドツーエンドの深層学習手法である発話レベルの順列不変訓練(uPIT)を導入する。uPITは発話全体の分離誤差を最小化することで、推論時に順列整合の必要性を排除する。uPITは、発話者数、アイデンティティ、性別の事前知識がなくても、発話者独立型のマルチスケイカー音声分離を可能にし、NMFやCASAを上回り、DPCLやDANetと同等の性能を発揮する。さらに、未学習の発話者や言語に対しても一般化可能である。

ABSTRACT

In this paper we propose the utterance-level Permutation Invariant Training (uPIT) technique. uPIT is a practically applicable, end-to-end, deep learning based solution for speaker independent multi-talker speech separation. Specifically, uPIT extends the recently proposed Permutation Invariant Training (PIT) technique with an utterance-level cost function, hence eliminating the need for solving an additional permutation problem during inference, which is otherwise required by frame-level PIT. We achieve this using Recurrent Neural Networks (RNNs) that, during training, minimize the utterance-level separation error, hence forcing separated frames belonging to the same speaker to be aligned to the same output stream. In practice, this allows RNNs, trained with uPIT, to separate multi-talker mixed speech without any prior knowledge of signal duration, number of speakers, speaker identity or gender. We evaluated uPIT on the WSJ0 and Danish two- and three-talker mixed-speech separation tasks and found that uPIT outperforms techniques based on Non-negative Matrix Factorization (NMF) and Computational Auditory Scene Analysis (CASA), and compares favorably with Deep Clustering (DPCL) and the Deep Attractor Network (DANet). Furthermore, we found that models trained with uPIT generalize well to unseen speakers and languages. Finally, we found that a single model, trained with uPIT, can handle both two-speaker, and three-speaker speech mixtures.

研究の動機と目的

  • 発話者独立型マルチスケイカー音声分離を、発話者数、アイデンティティ、性別の事前知識なしに実現すること。
  • フレームレベルの順列不変訓練(PIT)で必要な順列問題を推論時に解消すること。
  • 再トレーニングなしに2人および3人発話者混合音声を処理できる統合型モデルの開発。
  • 従来手法と比較して、未学習の発話者や言語への一般化性能の向上。

提案手法

  • uPITはフレームレベルのPITを拡張し、全発話全体の合計分離誤差を最小化する発話レベルの損失関数を導入する。
  • 再帰的ニューラルネットワーク(RNN)は、同じ発話者に属するフレームを同じ出力ストリームに割り当てるように、発話レベルの誤差を最小化することで学習される。
  • 発話レベルの目的関数によりトレーニング中に発話者固有のストリーム整合を学習することで、推論時に順列問題を回避する。
  • 発話者アイデンティティのアノテーションなしに混合音声データ上でエンドツーエンドで学習され、一貫した発話者分離を促すために発話レベル損失に依存する。
  • WSJ0およびデンマーク語データセットに、2人および3人発話者混合音声を適用し、RNNを用いて音声の順序的依存関係をモデル化する。
  • 訓練目的関数により、同じ発話者のフレームが、順列のあいまいさに関係なく、常に同じ出力ストリームに割り当てられる。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの深層学習モデルは、推論時に順列問題を解く必要なしに、発話者独立型マルチスケイカー音声分離を達成できるか?
  • RQ2発話レベル損失で学習することで、フレームレベルPITと比較して、未学習の発話者や言語への一般化性能が向上するか?
  • RQ31つのuPITモデルが、再トレーニングなしに2人および3人発話者混合音声を効果的に分離できるか?
  • RQ4uPITは、標準的なマルチスケイカー分離ベンチマークにおいて、NMF、CASA、DPCL、DANetと比較してどの程度の性能を示すか?

主な発見

  • uPITはWSJ0およびデンマーク語データセットの両方で、非負値行列分解(NMF)および計算聴覚シーン解析(CASA)を上回る性能を発揮する。
  • uPITは、同じベンチマークでディープクラスタリング(DPCL)およびディープアトラクターネットワーク(DANet)と同等の性能を達成する。
  • uPITで学習されたモデルは、未学習の発話者や言語に対しても良好に一般化され、学習分布外でも頑健であることが示された。
  • 2人および3人発話者混合音声の両方で学習された1つのuPITモデルは、再トレーニングやアーキテクチャの変更なしに、両方のシナリオを効果的に処理できる。
  • 発話レベルの訓練目的関数により、推論時に順列のあいまいさが効果的に解消され、後続処理の順列マッチングの必要性がなくなる。
  • 本手法は、トレーニング時に発話者アイデンティティや性別情報が不要であるにもかかわらず、エンドツーエンド手法の中で最先端の性能を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。