Skip to main content
QUICK REVIEW

[論文レビュー] Target Speaker Extraction for Overlapped Multi-Talker Speaker Verification

Wei Rao, Chenglin Xu|arXiv (Cornell University)|Feb 7, 2019
Speech Recognition and Synthesis参考文献 15被引用数 4
ひとこと要約

本稿では、重なった複数話者発話のためのターゲット話者抽出フレームワークを提案する。ターゲット話者抽出モジュールを用いて混合発話を前処理し、i-vector/PLDAベースの話者確認システムに供給する。この手法は相対的Equal Error Rate (EER) を65.7%低減し、SBF-MTSAL-ConcatがSBF-MTSALを上回る性能を示した。

ABSTRACT

The performance of speaker verification degrades significantly when the test speech is corrupted by interference speakers. Speaker diarization does well to separate speakers if the speakers are temporally overlapped. However, if multi-talkers speak at the same time, we need the technique to separate the speech in the spectral domain. This paper proposes an overlapped multi-talker speaker verification framework by using target speaker extraction methods. Specifically, given the target speaker information, the target speaker's speech is firstly extracted from the overlapped multi-talker speech by a target speaker extraction module. Then, the extracted speech is passed to the speaker verification system. Experimental results show that the proposed approach significantly improves the performance of overlapped multi-talker speaker verification and achieves 65.7% relative EER reduction.

研究の動機と目的

  • 複数話者が同時に発話する状況で話者確認性能が著しく低下することを是正すること。
  • 従来の音声分離手法が話者数の事前知識を必要とすることの制限を克服すること。
  • ターゲット話者抽出を用いて、完全に重なった複数話者状況における話者確認の耐性を向上させること。
  • 重なった複数話者環境下での2つのターゲット話者抽出ネットワーク(SBF-MTSAL と SBF-MTSAL-Concat)の有効性を比較すること。
  • クリアな音声と抽出音声の間の不一致を軽減するために、クリア音声と抽出音声の訓練データを統合すること。

提案手法

  • フレームワークは、登録発話を補助情報として用いて、混合発話からターゲット話者の音声を分離するターゲット話者抽出モジュールを採用する。
  • ターゲット話者抽出ネットワークは、位相に敏感なマスクを推定するために、マグニチュードおよび時間的スペクトル近似損失を採用し、音声再構成を改善する。
  • SBF-MTSAL は、CADNNベースのアーキテクチャでマスク推定を精緻化するための適応重みを生成する補助ネットワークを用いる。
  • SBF-MTSAL-Concat は、マスク推定の前に補助特徴と混合特徴を連結することで、表現学習を向上させ、SBF-MTSAL を強化する。
  • 抽出された音声は、標準的な i-vector/PLDA 話者確認システムを経由して処理され、確認が行われる。
  • 抽出音声を開発データからプールして作成された、クリア音声+抽出音声の統合訓練セットを用いることで、抽出音声とクリア音声の不一致を低減する。

実験結果

リサーチクエスチョン

  • RQ1ターゲット話者抽出が、完全に重なった複数話者状況における話者確認性能を顕著に向上させることができるか?
  • RQ2SBF-MTSAL と SBF-MTSAL-Concat の性能は、重なった複数話者発話の話者確認において、どのように比較されるか?
  • RQ3訓練段階でクリア音声と抽出音声を統合することで、話者確認における抽出音声とクリア音声の不一致はどの程度軽減されるか?
  • RQ4テスト音声が複数話者と完全に重なっている状況でも、提案フレームワークは耐性を維持できるか?
  • RQ5この設定におけるターゲット話者抽出の上限性能は何か? また、提案手法はその上限にどの程度近いか?

主な発見

  • 提案されたターゲット話者抽出フレームワークは、完全に重なったテストデータにおいて、ベースラインシステムと比較して等価誤り率(EER)を相対的に65.7%低減した。
  • SBF-MTSAL-Concat は SBF-MTSAL を上回り、重なった複数話者発話の話者確認において、より良い EER と DCF の性能を達成した。
  • クリア+抽出音声の統合訓練セットを用いることで、SBF-MTSAL-Concat を用いた混合テストセットでの性能向上が確認され、不一致の効果的低減が示された。
  • クリア+抽出音声の訓練セットは、クリアテストセットにおける EER を改善したが、DCF の性能を劣化させた。これは汎化性能にトレードオフがあることを示唆している。
  • ベースラインシステムは、完全に重なったテストデータにおいて顕著な性能低下を示しており、複数話者干渉の深刻さが浮き彫りになった。
  • 上限性能(理想の抽出)は、提案手法が最適に近いことを示しており、実用的導入における強い可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。