Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Supervised Speaker Diarization

Aonan Zhang, Quan Wang|arXiv (Cornell University)|2018. 10. 10.
Speech Recognition and Synthesis참고 문헌 24인용 수 8
한 줄 요약

이 논문은 시간이 겹치는 상태를 가진 비유한 중첩 상태 RNN( UIS-RNN)을 사용하여 완전히 지도 학습된 화자 디아라이제이션 시스템을 제안한다. 이는 공유된 RNN을 통해 각 화자를 모델링하고, 알려지지 않은 수의 화자를 다룰 수 있도록 거리 의존적 중국식 레스토랑 프로세스를 통합한다. 이 방법은 NIST SRE 2000 CALLHOME에서 7.6%의 디아라이제이션 오류율을 기록하여 기존의 스펙트럼 클러스터링을 능가하며, 온라인 추론을 가능하게 한다.

ABSTRACT

In this paper, we propose a fully supervised speaker diarization approach, named unbounded interleaved-state recurrent neural networks (UIS-RNN). Given extracted speaker-discriminative embeddings (a.k.a. d-vectors) from input utterances, each individual speaker is modeled by a parameter-sharing RNN, while the RNN states for different speakers interleave in the time domain. This RNN is naturally integrated with a distance-dependent Chinese restaurant process (ddCRP) to accommodate an unknown number of speakers. Our system is fully supervised and is able to learn from examples where time-stamped speaker labels are annotated. We achieved a 7.6% diarization error rate on NIST SRE 2000 CALLHOME, which is better than the state-of-the-art method using spectral clustering. Moreover, our method decodes in an online fashion while most state-of-the-art systems rely on offline clustering.

연구 동기 및 목표

  • 시간 스탬프가 부여된 화자 레이블이 제공될 경우, 화자 디아라이제이션에서 비지도 클러스터링의 한계를 해결한다.
  • 완전히 지도 학습된 예제로부터 학습 가능한 온라인 디아라이제이션 시스템을 개발한다.
  • 베이지안 비모수적 접근을 통해 각 발화에서 알려지지 않은 수의 화자를 다룰 수 있도록 한다.
  • d-벡터를 활용한 엔드 투 엔드 학습을 통해 기존의 클러스터링 기반 방법보다 디아라이제이션 성능을 향상시킨다.
  • 성능을 오프라인 클러스터링 방법과 유사하게 유지하면서도 온라인 디코딩을 가능하게 한다.

제안 방법

  • 각 화자를 시간에 따라 중첩된 상태를 가진 공유 파rameter RNN으로 모델링한다.
  • 거리 의존적 중국식 레스토랑 프로세스(ddCRP)를 사용하여 무한한 수의 화자를 허용하고, 화자 수를 동적으로 학습한다.
  • 관측치와 레이블의 결합 확률을 순차적 생성 모델로 설정한다: $ p( extbf{X}, extbf{Y}, extbf{Z}) = p( extbf{x}_1,y_1) imes extstyleigprod_{t=2}^T p( extbf{x}_t,y_t,z_t| extbf{x}_{[t-1]},y_{[t-1]},z_{[t-1]}) $, 여기서 $ z_t $ 는 화자 전환을 나타낸다.
  • 정답 화자 레이블을 사용하여 지도 학습을 통해 UIS-RNN 모델을 엔드 투 엔드로 학습한다.
  • 사전에 학습된 화자 인식 네트워크에서 추출한 화자 임베딩(d-벡터)를 UIS-RNN의 입력으로 통합한다.
  • 세그먼트를 순차적으로 처리함으로써 온라인 추론을 가능하게 하여 실시간 처리 능력을 유지한다.
Fig. 1 : The baseline system architecture [ 3 ] .
Fig. 1 : The baseline system architecture [ 3 ] .

실험 결과

연구 질문

  • RQ1시간 스탬프가 부여된 레이블이 존재할 경우, 완전히 지도 학습된 RNN 기반 접근 방식이 비지도 클러스터링을 능가할 수 있는가?
  • RQ2무한한, 중첩된 상태를 가진 RNN 모델이 사전 지식 없이 화자 수를 동적으로 학습할 수 있는가?
  • RQ3학습 가능한 순차 모델을 사용한 온라인 추론이 오프라인 클러스터링 방법과 유사한 성능을 달성할 수 있는가?
  • RQ4도메인 내 및 도메인 외 데이터에서의 학습이 UIS-RNN 시스템의 일반화 및 성능에 미치는 영향은 어떠한가?
  • RQ5UIS-RNN 프레임워크는 사전에 추출된 d-벡터 대신 원시 음성 특징을 사용하여 엔드 투 엔드 학습으로 확장될 수 있는가?

주요 결과

  • UIS-RNN 시스템은 도메인 내 5겹 교차 검증과 추가적인 도메인 외 데이터를 사용하여 NIST SRE 2000 CALLHOME 벤치마크에서 7.6%의 디아라이제이션 오류율(DER)을 달성했다.
  • 이 방법은 동일한 d-벡터를 사용한 스펙트럼 클러스터링(8.8% DER)과 k-means 클러스터링을 능가하여, 완전히 지도 학습의 이점을 입증했다.
  • d-벡터 V3(학습 및 추론 시 창크 사이즈가 일치)를 사용할 경우 성능이 크게 향상되어, k-means 기반의 DER이 V1의 12.3%에서 V3로 8.5%로 감소했다.
  • 도메인 외 데이터(Disk-6 + ICSI)로 학습하면 V3 기반 DER이 8.2%로 감소했으며, 도메인 내 및 도메인 외 데이터를 결합함으로써 DER은 7.6%로 더욱 향상되었다.
  • UIS-RNN 시스템은 오프라인 클러스터링 알고리즘의 성능을 따라하거나 초월하면서도 온라인 추론을 가능하게 하여, 속도와 정확도 사이의 상충관계를 깨뜨렸다.
  • 제안된 프레임워크는 화자 디아라이제이션 외에도 영상 기반 얼굴 클러스터링 등에 응용 가능하며, 순차적 클러스터링 설계 덕분에 일반적인 프레임워크로 활용 가능하다.
Fig. 2 : Generative process of UIS-RNN. Colors indicate labels for speaker segments. There are four options for $y_{7}$ given $\mathbf{x}_{[6]},y_{[6]}$ .
Fig. 2 : Generative process of UIS-RNN. Colors indicate labels for speaker segments. There are four options for $y_{7}$ given $\mathbf{x}_{[6]},y_{[6]}$ .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.