Skip to main content
QUICK REVIEW

[論文レビュー] Overlap-aware diarization: resegmentation using neural end-to-end overlapped speech detection

Latané Bullock, Hervé Bredin|arXiv (Cornell University)|Oct 25, 2019
Speech Recognition and Synthesis参考文献 21被引用数 85
ひとこと要約

本論文は、LSTM に基づく重なり音声検出器と、重なり領域で第2話者を割り当てる再セグメンテーションモジュールを提案し、AMI Headset mix におけるDERの最先端改善を達成し、重なりを考慮した2段階のダイアリゼーションパイプラインを導入する。

ABSTRACT

We address the problem of effectively handling overlapping speech in a diarization system. First, we detail a neural Long Short-Term Memory-based architecture for overlap detection. Secondly, detected overlap regions are exploited in conjunction with a frame-level speaker posterior matrix to make two-speaker assignments for overlapped frames in the resegmentation step. The overlap detection module achieves state-of-the-art performance on the AMI, DIHARD, and ETAPE corpora. We apply overlap-aware resegmentation on AMI, resulting in a 20% relative DER reduction over the baseline system. While this approach is by no means an end-all solution to overlap-aware diarization, it reveals promising directions for handling overlap.

研究の動機と目的

  • 重なり合う音声が存在する状況で堅牢なダイアリゼーションを動機づける。
  • エンドツーエンドまたは MFCC ベースの特徴を用いたニューラル重なり音声検出器(OSD)を開発する。
  • VB-HMM 後方分布を用いて重なり領域に第2話者を割り当てる再セグメンテーション手法を提案する。
  • 重なり検知と割り当てがダイアリゼーション性能(DER)に与える影響を評価する。
  • 再現性のあるベースラインとオープンソースリソースを提供し、さらなる研究を促進する。

提案手法

  • フレームごとに二値ラベルを付与する系列ラベリング課題として重なり音声検知を定式化する。
  • 固定長チャンクでデータ拡張を用いて、エンドツーエンドの波形または MFCC 特徴を用いた LSTM ベースの検出器を訓練し、バランスを取るために人工的な重なりを含める。
  • 重なりを持つスライディングウィンドウでテスト音声を処理し、ウィンドウ間でスコアを平均して重なりラベルの閾値決定を行う。
  • i-vector 後方分布をソフト話者後方確率行列として用いた VB-HMM 再セグメンテーションを使用し、重なりフレームのみ第2話者を割り当てる。
  • VB-HMM からの主要話者系列と第2話者割り当てを結合して結合ダイアリゼーション仮説を形成する。
Fig. 1 : The proposed pipeline for speaker diarization. The baseline incorporates end-to-end neural voice activity detection, speaker change detection, and speaker embeddings, with clustering performed via affinity propagation [ 11 ] . It is available in pyannote.audio toolkit [ 12 ] . The grey boxe
Fig. 1 : The proposed pipeline for speaker diarization. The baseline incorporates end-to-end neural voice activity detection, speaker change detection, and speaker embeddings, with clustering performed via affinity propagation [ 11 ] . It is available in pyannote.audio toolkit [ 12 ] . The grey boxe

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの重なり音声検出器は、多様なコーパス(AMI、DIHARD II、ETAPE)で手工特徴量ベースのベースラインを上回ることができるか?
  • RQ2重なり対応の再セグメンテーションと第2話者仮定を組み込むと、AMI Headset mix のような難易度の高いデータセットでDERを低減できるか?
  • RQ3オラクルと推定重なり検知および割り当てがDERおよび誤警報、検出漏れ、話者混同といった誤差成分にどう影響するか?

主な発見

  • エンドツーエンドの重なり音声検出は、AMI、DIHARD II、ETAPE のデータセットで最先端の精度/再現率を達成する。
  • 重なり対応の再セグメンテーションによる第2話者を用いたDERの相対的な削減はAMI Headset mixで20%(29.7%から23.8%へ)である。
  • VB-HMM再セグメンテーションは話者混同をわずかに減少させるが、主な利得は重なり検知と割り当てを組み合わせた重なり対応の割り当てから来る。
  • オラクルの重なり検知とオラクルの割り当てを用いるとDERはさらに11.8%に低下し、主に第2話者割り当ての改善余地を示している。
  • 高精度検知は見逃しを減らす一方で誤検出が僅かに増える可能性があり、第2話者の割り当ては検知/割り当ての改善がないと混乱を招く可能性がある。
  • AMI Headset mix で本手法は DER の新しい最先端を打ち立て、重なりを考慮したダイアリゼーションの可能性を示している。
Fig. 2 : To increase the number of positive training samples for overlapped speech detection, artificial audio chunks are created by summing two random audio chunks.
Fig. 2 : To increase the number of positive training samples for overlapped speech detection, artificial audio chunks are created by summing two random audio chunks.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。