Skip to main content
QUICK REVIEW

[論文レビュー] Speaker activity driven neural speech extraction

Marc Delcroix, Kateřina Žmolíková|arXiv (Cornell University)|Jan 14, 2021
Speech and Audio Processing参考文献 29被引用数 4
ひとこと要約

本稿では、登録発話や映像を必要とせず、単一チャネル混合音声からターゲット音声を抽出するためのニューラル音声抽出モデル ADEnet を提案する。発話活動情報を補助的手がかりとして用いることで、特に発話重なり度の高い状況下で、ダイアライゼーションと組み合わせることで、ASR において最高で 25% の相対的 WER 減少を達成し、登録ベース手法の実用的で多様性に富んだ代替手法を示している。

ABSTRACT

Target speech extraction, which extracts the speech of a target speaker in a mixture given auxiliary speaker clues, has recently received increased interest. Various clues have been investigated such as pre-recorded enrollment utterances, direction information, or video of the target speaker. In this paper, we explore the use of speaker activity information as an auxiliary clue for single-channel neural network-based speech extraction. We propose a speaker activity driven speech extraction neural network (ADEnet) and show that it can achieve performance levels competitive with enrollment-based approaches, without the need for pre-recordings. We further demonstrate the potential of the proposed approach for processing meeting-like recordings, where the speaker activity is obtained from a diarization system. We show that this simple yet practical approach can successfully extract speakers after diarization, which results in improved ASR performance, especially in high overlapping conditions, with a relative word error rate reduction of up to 25%.

研究の動機と目的

  • 事前録音された登録発話を必要としない、発話活動を駆動する音声抽出手法の開発を目的とする。
  • 発話活動情報が、単一チャネル音声抽出における実用的で効果的な補助的手がかりとして機能できるかどうかを調査することを目的とする。
  • ADEnet をダイアライゼーションシステムと統合することで、会議風録音における ASR 性能を向上させるかどうかを評価することを目的とする。
  • 発話活動の手がかりのみで、複数話者が同時に話している領域であっても、高品質な音声抽出が可能であることを示すこと

提案手法

  • ADEnet は、音声混合波形と時間的に同期した発話活動信号を入力とする単一チャネルニューラルネットワークである。
  • 発話活動信号は、フレーム単位でターゲット話者が活動中かどうかを示し、抽出ネットワークの空間的・時間的マスクとして機能する。
  • ネットワーク構造は、微細なスペクトルディテールを保持するためのスキップ接続を備えた U-Net に類似したエンコーダ-デコーダ構造を採用している。
  • モデルは、抽出音声と基準音声の間の信号対歪み比(SDR)を最大化する損失関数を用いて、エンドツーエンドで訓練される。
  • 実世界の状況では、発話活動信号はダイアライゼーションシステム(例:TS-VAD)から得られ、即座に統合可能なプラグアンドプレイ型の設計となっている。
  • 不完全な活動信号に対してもロバストであり、ノイズや重なり領域が発話手がかりに含まれる状況でも性能が維持される

実験結果

リサーチクエスチョン

  • RQ1登録発話を必要としない状況で、発話活動情報のみがニューラル音声抽出における効果的な補助的手がかりとして機能できるか?
  • RQ2Oracle 条件およびノイズ混在条件の下で、ADEnet は SpeakerBeam などの登録ベース手法と比較してどのように性能を発揮するか?
  • RQ3会議風録音において、ADEnet をダイアライゼーションと統合することで、ASR 性能はどの程度向上するか?
  • RQ4複数話者が同時に活動している重なり領域では、ADEnet はどのように対処するか?

主な発見

  • Oracle 発話活動を用いた ADEnet は、登録発話を必要としないにもかかわらず、SpeakerBeam の 9.4 dB に対して、10.2 dB の高い信号対歪み比(SDR)を達成した。
  • ノイズ混在の学習条件下で訓練された ADEnet-mix は、非活動マスク法およびベースライン SpeakerBeam を上回り、特にノイズや不完全な発話活動信号の状況下で優れた性能を示した。
  • TS-VAD を用いたダイアライゼーションと統合した場合、ADEnet は重なり度の高い状況(OV40)で cpWER を最大 25% 減少させ、29.8% の WER を達成した(ADEnet 無しでは 33.6%)。
  • 発話活動信号の品質が変動しても安定した性能を維持しており、ダイアライゼーションの誤りや重なり領域に対してもロバストであることが示された。
  • 抽出音声の定性的な例から、ADEnet は重なり領域であっても、効果的な単一チャネル音声抽出が可能であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。