Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-scale Speaker Diarization with Dynamic Scale Weighting

Tae Jin Park, Nithin Rao Koluguri|arXiv (Cornell University)|2022. 03. 30.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 1D CNN를 사용하여 각 시간 단계에서 다양한 시간 해상도에 대한 중요도를 적응적으로 할당하는 동적 스케일 가중치 메커니즘을 갖춘 다중 척도 발화자 디아라이제이션 시스템을 제안한다. 다중 척도 클러스터링으로 초기화하고, 프레임 단위로 발화자 레이블을 추정하는 LSTM 기반 디코더를 활용함으로써, 반복적 보정 없이도 오버랩 인식이 가능하고 변동 가능한 발화자 수를 유연하게 처리할 수 있으며, CALLHOME에서 3.92% DER, AMI MixHeadset에서 1.05% DER의 최신 기술 수준 성능을 달성한다.

ABSTRACT

Speaker diarization systems are challenged by a trade-off between the temporal resolution and the fidelity of the speaker representation. By obtaining a superior temporal resolution with an enhanced accuracy, a multi-scale approach is a way to cope with such a trade-off. In this paper, we propose a more advanced multi-scale diarization system based on a multi-scale diarization decoder. There are two main contributions in this study that significantly improve the diarization performance. First, we use multi-scale clustering as an initialization to estimate the number of speakers and obtain the average speaker representation vector for each speaker and each scale. Next, we propose the use of 1-D convolutional neural networks that dynamically determine the importance of each scale at each time step. To handle a variable number of speakers and overlapping speech, the proposed system can estimate the number of existing speakers. Our proposed system achieves a state-of-art performance on the CALLHOME and AMI MixHeadset datasets, with 3.92% and 1.05% diarization error rates, respectively.

연구 동기 및 목표

  • 발화자 디아라이제이션에서 시간 해상도와 발화자 표현의 정밀도 사이의 상충 관계를 해결하기 위해.
  • 후처리 또는 재분할이 필요 없이 오버랩 인식 디아라이제이션을 가능하게 하기 위해.
  • 추론 중에 알려지지 않은 또는 변동 가능한 발화자 수를 포함하여 민첩한 수의 발화자 수를 지원하기 위해.
  • 다중 척도 표현에 대한 동적 가중치를 적용하여 이전의 클러스터링 기반 및 시퀀스 모델 기반 디아라이제이션 시스템의 성능을 향상시키기 위해.

제안 방법

  • 시스템은 사전 학습된 발화자 임베딩 추출기(TitaNet)를 사용하여 프레임 단위 임베딩을 생성한다.
  • 다중 척도 클러스터링은 다양한 시간 해상도에서의 발화자 수 추정 및 평균 발화자 표현 추정을 통해 시스템을 초기화한다.
  • 1D CNN은 입력 임베딩과 클러스터 중심점에 기반하여 각 시간 단계에서 동적 스케일 가중치를 계산한다.
  • 스케일 가중치를 사용하여 발화자 임베딩과 클러스터 표현 간의 가중 코사인 유사도를 계산한다.
  • LSTM 기반 시퀀스 모델은 각 프레임의 이진 발화자 레이블을 예측하며, 다차원 시그모이드 출력을 통해 오버랩 인식 디아라이제이션을 가능하게 한다.
  • 모든 발화자 쌍에 대한 시그모이드 출력을 평균화하여 발화자 레이블을 추론함으로써, 알려지지 않은 발화자 수에 대한 민감한 처리가 가능하다.
Figure 1: Data-flow of the proposed multi-scale speaker diarization system.
Figure 1: Data-flow of the proposed multi-scale speaker diarization system.

실험 결과

연구 질문

  • RQ1동적 스케일 가중치 메커니즘이 다양한 시간 해상도에서 디아라이제이션 성능을 향상시킬 수 있는가?
  • RQ2클러스터링 기반 초기화에서 동적 스케일 가중치는 정적 또는 최적화된 스케일 가중치보다 어떻게 비교되는가?
  • RQ3클러스터링 초기화를 갖는 엔드 투 엔드 시퀀스 모델이 반복적 보정 없이도 변동 가능한 수의 발화자를 처리할 수 있는가?
  • RQ4제안된 시스템이 표준 벤치마크에서 기존 최신 기술 수준의 모듈식 및 엔드 투 엔드 디아라이제이션 시스템을 얼마나 뛰어나게 하는가?
  • RQ5동적 가중치 메커니즘이 다중 척도 디아라이제이션에서 하이퍼파라미터 튜닝에 대한 의존도를 줄이는가?

주요 결과

  • 제안된 Equal-w-MSDD 시스템은 CALLHOME 테스트 세트에서 3.92%의 디아라이제이션 오류율(DER)을 달성하여 이전 최신 기술 수준의 방법들을 능가한다.
  • AMI MixHeadset 데이터셋에서 시스템은 1.05% DER을 기록하여 새로운 최신 기술 수준의 성능을 달성한다.
  • 최적화된 스케일 가중치를 사용하는 Opt-w-MSDD 변종은 Equal-w-MSDD보다 略적으로 더 좋은 성능을 내지만, 후자는 하이퍼파라미터 튜닝 없이도 뛰어난 강건성을 보인다.
  • 이전의 클러스터링 기반 다중 척도 방법에 비해 스케일 가중치 튜닝에 민감도가 낮아, 알려지지 않은 도메인에서도 안정적인 성능을 보인다.
  • 동적 스케일 가중치 메커니즘은 추가적인 재분할 또는 반복적 보정 단계 없이도 효과적인 오버랩 인식 디아라이제이션을 가능하게 한다.
  • 가장 세밀한 스케일이 0.5초 이하로 감소하더라도 시스템은 높은 정확도를 유지하지만, 매우 짧은 스케일에서는 성능이 약간 저하된다.
Figure 2: Cosine similarity values from each speaker and each scale are weighted by the scale weights to form a weighted cosine similarity vector.
Figure 2: Cosine similarity values from each speaker and each scale are weighted by the scale weights to form a weighted cosine similarity vector.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.