Skip to main content
QUICK REVIEW

[논문 리뷰] Separation Guided Speaker Diarization in Realistic Mismatched Conditions

Shutong Niu, Jun Du|arXiv (Cornell University)|2021. 07. 06.
Speech and Audio Processing참고 문헌 28인용 수 5
한 줄 요약

이 논문은 실제 불일치 조건에서 겹치는 말하기 상황에서 성능을 햖थ기 위해 클러스터링 기반 다이어라이제이션(CSD)과 분리 기반 다이어라이제이션(SSD) 결과 사이에서 동적으로 전환하는 Separation Guided Speaker Diarization(SGSD) 프레임워크를 제안한다. 음성 지속 시간 불균형, 겹침 비율, 상대 다이어라이제이션 오류율을 통한 불안정성 탐지 기반으로, SGSD는 DIHARD-III CTS 데이터셋의 개발 세트에서 DER을 20.2% 감소시키고 평가 세트에서는 20.8% 감소시켰다.

ABSTRACT

We propose a separation guided speaker diarization (SGSD) approach by fully utilizing a complementarity of speech separation and speaker clustering. Since the conventional clustering-based speaker diarization (CSD) approach cannot well handle overlapping speech segments, we investigate, in this study, separation-based speaker diarization (SSD) which inherently has the potential to handle the speaker overlap regions. Our preliminary analysis shows that the state-of-the-art Conv-TasNet based speech separation, which works quite well on the simulation data, is unstable in realistic conversational speech due to the high mismatch speaking styles in simulated training speech and read speech. In doing so, separation-based processing can assist CSD in handling the overlapping speech segments under the realistic mismatched conditions. Specifically, several strategies are designed to select between the results of SSD and CSD systems based on an analysis of the instability of the SSD system performances. Experiments on the conversational telephone speech (CTS) data from DIHARD-III Challenge show that the proposed SGSD system can significantly improve the performance of state-of-the-art CSD systems, yielding relative diarization error rate reductions of 20.2% and 20.8% on the development set and evaluation set, respectively.

연구 동기 및 목표

  • 실제 대화 환경에서 겹치는 말하기 영역에서 클러스터링 기반 다이어라이제이션(CSD)의 열악한 성능을 해결하기 위해.
  • 대화 전화 음성(CTS)과 같은 실세계의 불일치 데이터에서 최신 음성 분리 기술(예: Conv-TasNet)의 불안정성을 극복하기 위해.
  • 분리 신뢰도에 기반해 CSD와 SSD의 우수한 출력을 지능적으로 선택함으로써 CSD와 SSD의 장점을 모두 활용하는 하이브리드 시스템을 개발하기 위해.
  • 학습 데이터와 테스트 데이터가 말하기 스타일에서 다를 수 있는 실제 불일치 조건에서 DIHARD-III CTS 데이터셋의 다이어라이제이션 성능을 향상시키기 위해.

제안 방법

  • CSD와 SSD의 성능을 비교하기 위해 기준 시스템으로 VBx 기반 클러스터링 기반 다이어라이제이션(CSD)을 사용하고, 겹치는 영역에서의 후행 처리를 위해 사용한다.
  • 세 가지 탐지 전략 설계: (1) 음성 지속 시간 불균형 검사(SGSD1), (2) 높은 겹침 비율 탐지(SGSD2), (3) CSD와 SSD 간 상대 다이어라이제이션 오류율(DER) 비교(SGSD3).
  • 분리 기반 다이어라이제이션(SSF)을 위한 기준 시스템으로 VBx 기반 클러스터링 기반 다이어라이제이션(CSD)을 사용하고, 겹치는 영역에서의 후행 처리를 위해 사용한다.
  • SGSD3를 주요 선택 메커니즘으로 적용하여, SSD와 CSD 간 상대 DER을 기반으로 분리의 신뢰도를 평가하고 시스템 출력을 안내한다.
  • 다양한 탐지 전략(예: SGSD1 및 SGSD2)을 조합하여 불안정한 분리 사례의 탐지 성능을 향상시킨다.
  • 여러 탐지 방법 간 투표 또는 앙상블 전략을 적용하지만, 오류 전파로 인해 수익 감소 현상이 발생한다.

실험 결과

연구 질문

  • RQ1실제 불일치 조건에서 겹치는 말하기 영역에서 분리 기반 다이어라이제이션(SSD)이 클러스터링 기반 다이어라이제이션(CSD)을 능가할 수 있는가?
  • RQ2실제 대화 음성에서 음성 분리(예: Conv-TasNet)의 불안정성을 어떻게 탐지하고 완화할 수 있는가?
  • RQ3실제로 분리 품질의 진단을 위한 지표가 없을 경우, CSD와 SSD 출력 간 선택을 안내하는 효과적이고 신뢰할 수 있는 지표는 무엇인가?
  • RQ4단독 CSD나 SSD보다 하이브리드 SGSD 시스템이 실세계의 불일치 CTS 데이터에서 다이어라이제이션 성능을 얼마나 향상시킬 수 있는가?

주요 결과

  • 제안된 SGSD 시스템은 기준 CSD 시스템 대비 DIHARD-III CTS 개발 세트에서 다이어라이제이션 오류율(DER)을 20.2% 감소시키고 평가 세트에서는 20.8% 감소시켰다.
  • CSD와 SSD 간 상대 DER을 선택 기준으로 사용하는 SGSD3는 평가 세트에서 90%의 정확도로 가장 높은 탐지 성능를 기록했으며, 개별 전략보다 뛰어난 성능을 보였다.
  • SGSD1과 SGSD2의 조합은 평가 세트에서 85%의 정확도로 탐지 성능을 향상시켜 두 전략이 상호 보완적임을 입증했다.
  • 세 전략을 모두 투표하여 조합했음에도 불구하고, SGSD1과 SGSD2의 오류 전파로 인해 성능이 약간 저하되어 앙상블 설계의 상충관계를 보여주었다.
  • CSD 시스템은 단독으로 개발 세트에서 4.2%, 평가 세트에서 3.7%의 낮은 화자 오류율을 기록했지만, 겹침을 처리하지 못해 높은 누락 오류율(개발 세트 12.0%)을 보였다.
  • SGSD3는 개발 세트에서 CSD의 12.0%에서 SGSD3의 7.6%로 누락 오류율을 감소시켜 오라클 성능(7.5% 누락 오류율)에 가까워졌으며, 겹치는 말하기 상황 처리의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.