Skip to main content
QUICK REVIEW

[論文レビュー] Improving speaker discrimination of target speech extraction with time-domain SpeakerBeam

Marc Delcroix, Tsubasa Ochiai|arXiv (Cornell University)|Jan 23, 2020
Speech and Audio Processing参考文献 24被引用数 12
ひとこと要約

本論文は、特に同性混合音声においても話者識別性能を向上させるために、時間領域での実装であるSpeakerBeam(TD-SpeakerBeam)を提案する。時間領域ネットワークを用い、内部結合による空間特徴の統合、およびマルチタスク話者識別損失の適用により、周波数領域のSpeakerBeamやTasNetベースのベースラインを上回る性能を達成し、最大1 dBのSDR向上を実現するとともに、同性・異性混合音声間の性能差を顕著に縮小した。

ABSTRACT

Target speech extraction, which extracts a single target source in a mixture given clues about the target speaker, has attracted increasing attention. We have recently proposed SpeakerBeam, which exploits an adaptation utterance of the target speaker to extract his/her voice characteristics that are then used to guide a neural network towards extracting speech of that speaker. SpeakerBeam presents a practical alternative to speech separation as it enables tracking speech of a target speaker across utterances, and achieves promising speech extraction performance. However, it sometimes fails when speakers have similar voice characteristics, such as in same-gender mixtures, because it is difficult to discriminate the target speaker from the interfering speakers. In this paper, we investigate strategies for improving the speaker discrimination capability of SpeakerBeam. First, we propose a time-domain implementation of SpeakerBeam similar to that proposed for a time-domain audio separation network (TasNet), which has achieved state-of-the-art performance for speech separation. Besides, we investigate (1) the use of spatial features to better discriminate speakers when microphone array recordings are available, (2) adding an auxiliary speaker identification loss for helping to learn more discriminative voice characteristics. We show experimentally that these strategies greatly improve speech extraction performance, especially for same-gender mixtures, and outperform TasNet in terms of target speech extraction.

研究の動機と目的

  • 話者の声の特徴が類似する場合、特に同性混合音声において話者識別性能が著しく低下する問題に取り組むこと。
  • TasNetのような時間領域ニューラルネットワークの利点を活かし、SpeakerBeamの周波数領域処理から時間領域処理への移行により、性能を向上させること。
  • 入力レベルの統合ではなく、ネットワーク内での内部結合メカニズムを用いてマイクロホンアレイからの空間特徴(左右相関差:IPD)を統合し、話者識別性能を向上させること。
  • 音声再構成と話者識別という2つの目的を統合したマルチタスク損失を導入することで、より判別力の高い話者埋め込みを学習すること。
  • 特に話者の数を含めたトレーニングデータの多様性が、話者識別性能に与える影響を調査すること。

提案手法

  • 時間領域でのSpeakerBeamの実装として、raw音声信号を直接処理するTD-SpeakerBeamを提案。周波数領域のスペクトログ램の代わりに時間領域の波形を用いる。
  • 適応発話からより豊富で判別力の高い話者埋め込みベクトルを抽出するため、シーケンス要約ネットワークを畳み込みネットワークに置き換える。
  • マイクロホンアレイから得られる左右相関差(IPD)特徴を内部結合メカニズムで統合することで、ネットワークアーキテクチャ内での空間特徴の有効活用を可能にする。
  • 音声再構成損失と話者識別損失(SI-loss)を統合したマルチタスク損失を採用し、モデルがより判別力の高い話者埋め込みを学習するように促進する。
  • 2段階のトレーニング戦略を採用:まずSI-lossを用いて話者埋め込み抽出器を事前学習し、その後、共同損失最適化により全システムを微調整する。
  • 単一マイクロホンおよびマルチマイクロホンの両設定に本手法を適用し、性別組み合わせやトレーニングデータ規模の異なる条件下で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1SpeakerBeamの時間領域実装は、周波数領域実装と比較して、ターゲット音声抽出性能を向上させることができるか?
  • RQ2マイクロホンアレイからの空間特徴を内部結合メカニズムで統合することで、特に同性混合音声において話者識別性能が向上するか?
  • RQ3音声再構成と話者識別という2つの目的を統合したマルチタスク損失は、話者埋め込みの判別力の質を向上させることができるか?
  • RQ4トレーニングに用いる話者の数が、ターゲット音声抽出における同性混合と異性混合の性能差に与える影響は何か?
  • RQ5本手法は、難易度の高い条件下でも、最先端の音声分離システムに続いてターゲット話者選択を実行する手法を上回る性能を示すか?

主な発見

  • TD-SpeakerBeamは、周波数領域のSpeakerBeam(FD-SpeakerBeam)およびTasNetベースのベースラインを上回り、MC-WSJ0-2mixデータセットで平均11.17 dBのSDRを達成した。これに対してFD-SpeakerBeamは10.27 dBであった。
  • TD-SpeakerBeamにおけるIPD特徴の内部結合により、入力レベルの統合と比較して最大1 dBのSDR向上が達成され、平均で11.45 dBの最高性能を記録した。
  • SI-lossの導入により、SDRが最大1 dBまで一貫して向上し、特に同性混合音声において顕著な効果を示した。937人のトレーニング話者を用いたCSJ-2mixでは、平均SDRが17.81 dBに達した。
  • トレーニング話者の数が増えるにつれてTD-SpeakerBeamの性能が顕著に向上した(特に同性混合音声において)が、TasNetの性能はほとんど変化しなかった。これは、SpeakerBeamが話者多様性の恩恵をより強く受けることを示している。
  • 同性混合音声における処理失敗(SDR向上 ≤ 0 dB)の発生率が低減され、937人のトレーニング話者とSI-lossを組み合わせた場合、すべての性別組み合わせにおいて最も一貫性があり、堅牢な性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。