Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Speaker Diarization with Speaker-Wise Chain Rule

Yusuke Fujita, Shinji Watanabe|arXiv (Cornell University)|2020. 06. 02.
Speech Recognition and Synthesis참고 문헌 36인용 수 41
한 줄 요약

확률적 체인 규칙을 이용해 화자 활동을 순차적으로 해독하는 화자-별 조건 추론 방법(SC-EEND)을 제시하여, 가변 화자 수를 가능하게 하고 이전 EEND 방법에 비해 DER을 개선한다.

ABSTRACT

Speaker diarization is an essential step for processing multi-speaker audio. Although an end-to-end neural diarization (EEND) method achieved state-of-the-art performance, it is limited to a fixed number of speakers. In this paper, we solve this fixed number of speaker issue by a novel speaker-wise conditional inference method based on the probabilistic chain rule. In the proposed method, each speaker's speech activity is regarded as a single random variable, and is estimated sequentially conditioned on previously estimated other speakers' speech activities. Similar to other sequence-to-sequence models, the proposed method produces a variable number of speakers with a stop sequence condition. We evaluated the proposed method on multi-speaker audio recordings of a variable number of speakers. Experimental results show that the proposed method can correctly produce diarization results with a variable number of speakers and outperforms the state-of-the-art end-to-end speaker diarization methods in terms of diarization error rate.

연구 동기 및 목표

  • 엔드-투-엔드 신경 다이어라이제이션(EEND)에서의 고정 화자 수 한계를 해결한다.
  • 확률적 연쇄 규칙에 기반한 화자-별 조건 추론 프레임워크를 제안한다.
  • 종료 조건을 갖춘 가변 화자 수에 대한 다이어라이제이션을 가능하게 한다.
  • 학습 안정성과 성능 향상을 위해 테처 포싱(teacher forcing)을 도입한다.
  • CALLHOME 및 가변 화자 데이터 세트를 시뮬레이션하여 EEND 및 x-vector+AHC 방법과 비교 평가한다.

제안 방법

  • 화자 다이어라이제이션을 화자별 음성 활동 랜덤 변수들의 공동 분포로 모델링하고 체인 룰을 통해 이전에 추정된 화자를 사용하여 순차적으로 해독한다(P(y1,...,yS|X)).
  • X와 이전 화자의 음성 활동을 입력으로 받아 z_s,t 확률을 생성하는 화자-별 조건부 신경망(SCNN)을 사용한다.
  • Transformer 인코더와 LSTM 기반 디코더를 갖는 인코더-디코더 아키텍처를 채택하여 가변 길이의 화자 출력을 생성한다.
  • 화자 순서를 다루기 위해 순열 불변 학습(PIT)으로 학습하며; 두 가지 손실 전략(그리디 및 TF를 포함한 이단계 PIT)을 탐구한다.
  • 학습 중에는 실제 이전 화자 활동을 입력하여 교사 강제(teacher forcing)를 적용하고, 최적의 화자 순서를 결정하기 위해 이단계 PIT 손실을 사용한다.
  • 0 벡터가 생성될 때까지 디코딩을 반복하여 더 이상 화자가 없음을 신호한다.

실험 결과

연구 질문

  • RQ1화자-별 체인 룰 기반 모델이 가변 화자 수를 처리하면서도 정확한 다이어라이제이션을 생성할 수 있는가?
  • RQ2각 화자를 이전에 추정된 화자들에 조건화하는 것이 전통적인 EEND보다 성능을 향상시키는가?
  • RQ3가변 화자 시나리오에서 교사 강제와 이단계 PIT가 다이어라이제이션 오류율(DER)에 미치는 영향은 무엇인가?
  • RQ4고정된 두 화자와 가변 화자 데이터셋에서 SC-EEND가 x-vector+AHC 및 표준 EEND와 어떻게 비교되는가?

주요 결과

  • PIT+TF를 적용한 SC-EEND가 두 화자 CALLHOME에서 기존 EEND에 비해 DER을 개선한다(8.86% 대 9.70%).
  • 가변 화자 시뮬레이션 데이터에서 PIT+TF를 적용한 SC-EEND가 EEND 및 Greedy+TF를 능가하는 강한 DER을 보이며, 화자 수가 증가할수록 특히 그렇다.
  • 가변 화자 CALLHOME에서 PIT+TF를 적용한 SC-EEND가 DER 15.75%를 달성하여 x-vector+AHC 및 EEND 베이스라인보다 우수하다.
  • TF가 없는 SC-EEND는 이득이 제한적이며, 변수 화자 설정에서 TF가 성능을 크게 향상시킨다.
  • 두단계 PIT 손실은 여러 실험에서 Greedy+TF나 단일 단계 PIT보다 약간 더 나은 DER를 일반적으로 보인다.
  • SC-EEND는 x-vector+AHC보다 화자 수 계산 정확도가 더 높지만, 4명을 넘는 화자 처리에는 여전히 도전이 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.