Skip to main content
QUICK REVIEW

[논문 리뷰] Overlap-aware diarization: resegmentation using neural end-to-end overlapped speech detection

Latané Bullock, Hervé Bredin|arXiv (Cornell University)|2019. 10. 25.
Speech Recognition and Synthesis참고 문헌 21인용 수 85
한 줄 요약

이 논문은 LSTM 기반의 중첩 음성 탐지기와 중첩 영역에서 두 번째 화자를 할당하는 재세그먼트 모듈을 도입하여 AMI Headset mix에서 SOTA DER 개선을 달성하고 중첩 인지를 고려한 2단계 다이어리제이션 파이프라인을 도입한다.

ABSTRACT

We address the problem of effectively handling overlapping speech in a diarization system. First, we detail a neural Long Short-Term Memory-based architecture for overlap detection. Secondly, detected overlap regions are exploited in conjunction with a frame-level speaker posterior matrix to make two-speaker assignments for overlapped frames in the resegmentation step. The overlap detection module achieves state-of-the-art performance on the AMI, DIHARD, and ETAPE corpora. We apply overlap-aware resegmentation on AMI, resulting in a 20% relative DER reduction over the baseline system. While this approach is by no means an end-all solution to overlap-aware diarization, it reveals promising directions for handling overlap.

연구 동기 및 목표

  • 중첩 음성이 존재하는 상황에서 강건한 다이어리제이션의 필요성을 제시한다.
  • 엔드투엔드 또는 MFCC 기반 특징을 사용하는 신경망 중첩 음성 탐지기(OSD)를 개발한다.
  • VB-HMM 후처리 확률을 사용해 중첩 영역에서 2번째 화자를 할당하는 재세그먼션 방법을 제안한다.
  • 다이어리제이션 성능(DER)에 대한 중첩 탐지 및 할당의 영향을 평가한다.
  • 재현 가능한 기준선과 오픈소스 자원을 제공하여 연구를 촉진한다.

제안 방법

  • 중첩 음성 탐지를 프레임당 이진 라벨이 있는 시퀀스 라벨링 문제로 공식화한다.
  • 데이터 증강을 포함한 균형 확보를 위해 고정 길이 청크에서 엔드투엔드 파형 또는 MFCC 특징으로 LSTM 기반 탐지기를 훈련한다.
  • 테스트 음원을 중첩 슬라이딩 윈도우로 처리하고 윈도우 간 평균 점수로 중첩 라벨 임계값을 구한다.
  • i-vector 후처리를 soft 화자 후확률 행렬로 사용하는 VB-HMM 재세그먼트를 적용하고 중첩 프레임에 대해서만 두 번째 화자를 할당한다.
  • VB-HMM에서 1차 화자 시퀀스와 2차 화자 할당을 결합해 합성 다이어리제이션 가설을 형성한다.
Fig. 1 : The proposed pipeline for speaker diarization. The baseline incorporates end-to-end neural voice activity detection, speaker change detection, and speaker embeddings, with clustering performed via affinity propagation [ 11 ] . It is available in pyannote.audio toolkit [ 12 ] . The grey boxe
Fig. 1 : The proposed pipeline for speaker diarization. The baseline incorporates end-to-end neural voice activity detection, speaker change detection, and speaker embeddings, with clustering performed via affinity propagation [ 11 ] . It is available in pyannote.audio toolkit [ 12 ] . The grey boxe

실험 결과

연구 질문

  • RQ1종합 데이터셋(AMI, DIHARD II, ETAPE)에서 엔드투엔드 중첩 음성 탐지가 수작업 특징 기반의 벤치마크를 능가할 수 있는가?
  • RQ2AMI Headset mix와 같은 도전적 데이터에서 중첩 인지를 고려한 재세그먼션과 두 번째 화자 가설이 DER을 감소시키는가?
  • RQ3오라클 vs. 예측 중첩 탐지 및 할당이 DER 및 오탐/누락/화자 혼동 등 오차 구성요소에 어떤 영향을 미치는가?

주요 결과

  • 엔드투엔드 중첩 음성 탐지는 AMI, DIHARD II, ETAPE 데이터셋에서 최첨단 정밀도/재현률을 달성했다.
  • 중첩 인지를 고려한 재세그먼션과 두 번째 화자 할당은 AMI Headset mix에서 DER을 상대적으로 20% 감소시켰다(29.7%에서 23.8%).
  • VB-HMM 재세그먼트는 화자 혼동을 약간 감소시키나, 주요 이익은 중첩 인지 할당에서 나온다.
  • 오라클 중첩 탐지 및 오라클 할당을 가정할 경우 DER이 더 낮아져 11.8%에 도달하며, 주로 2차 화자 할당에서 추가 개선의 여지가 있음을 시사한다.
  • 고정밀 탐지는 누락을 줄이지만 오탐이 다소 증가할 수 있으며, 2차 화자 할당은 탐지/할당이 개선되지 않으면 혼동을 증가시킬 수 있다.
  • AMI Headset mix에서 본 접근법은 DER의 새로운 SOTA를 제시하고 중첩 인지 다이어리제이션의 잠재력을 보여준다.
Fig. 2 : To increase the number of positive training samples for overlapped speech detection, artificial audio chunks are created by summing two random audio chunks.
Fig. 2 : To increase the number of positive training samples for overlapped speech detection, artificial audio chunks are created by summing two random audio chunks.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.