[논문 리뷰] The ByteDance Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2021
이 논문은 VoxSRC-2021 챌린지에 참가한 ByteDance의 화자 분리 시스템을 제시하며, VAD, ECAPA-TDNN 기반 화자 임베딩, 자동 튜닝된 스펙트럼 클러스터링 및 재클러스터링을 위한 응집형 계층적 클러스터링(AHC), pyannote 기반의 겹침 음성 감지, 그리고 다중 시간 스케일에서의 DOVER-Lap 융합을 통합한다. 시스템은 평가 세트에서 5.15%의 화자 분리 오류율(DER)을 기록하여 챌린지에서 2위를 차지했다.
This paper describes the ByteDance speaker diarization system for the fourth track of the VoxCeleb Speaker Recognition Challenge 2021 (VoxSRC-21). The VoxSRC-21 provides both the dev set and test set of VoxConverse for use in validation and a standalone test set for evaluation. We first collect the duration and signal-to-noise ratio (SNR) of all audio and find that the distribution of the VoxConverse's test set and the VoxSRC-21's test set is more closer. Our system consists of voice active detection (VAD), speaker embedding extraction, spectral clustering followed by a re-clustering step based on agglomerative hierarchical clustering (AHC) and overlapped speech detection and handling. Finally, we integrate systems with different time scales using DOVER-Lap. Our best system achieves 5.15\% of the diarization error rate (DER) on evaluation set, ranking the second at the diarization track of the challenge.
연구 동기 및 목표
- 실세계의 다양한 노이즈, 겹침, 녹음 조건을 가진 오디오에 대해 강건한 화자 분리 시스템을 개발하기 위해.
- 유튜브 인터뷰 및 토론 영상에서 얻은 장시간, 노이즈가 많고 겹치는 음성 세그먼트에서의 화자 분리 과제를 해결하기 위해.
- 다중 스케일 시스템 융합과 겹침 음성의 효과적인 처리를 통해 화자 분리 성능을 향상시키기 위해.
- VoxConverse 및 VoxSRC-2021 평가 세트에서의 신호 대 잡음비(SNR) 및 지속시간 분포에 대한 통계 분 析을 통해 클러스터링 및 VAD 구성 요소를 최적화하기 위해.
- 체계적인 구성 요소 선별 및 통합을 통해 VoxSRC-2021 화자 분리 트랙에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 시스템은 pyannote 2.0의 VAD를 사용해 음성 세그먼트를 분리하며, VoxConverse dev2 세트에서 최적의 성능을 보였다.
- ECAPA-TDNN 모델을 사용해 음성 임베딩을 추출하였으며, 이는 SpeechBrain를 활용하고 광범위한 데이터 증강 기법을 적용해 훈련하였다.
- 초기 클러스터링은 균일하게 분할된 짧은 클립(0.25s–0.75s 이격)에 대해 스펙트럼 클러스터링을 통해 수행되며, 이후 AHC 기반 재클러스터링을 통해 화자 경계를 정밀화한다.
- 겹침 음성은 DIHARD3, AMI, VoxConverse dev1에서 사전 훈련된 pyannote 모델을 사용해 감지하며, 그리드 서치를 통해 임계치를 튜닝한다.
- 시간 시계열 기반의 최근접 이웃 전략을 통해 겹침 세그먼트를 겹침 이전 및 이후의 두 가장 가까운 화자에게 할당한다.
- 세 가지 시간 스케일(0.25s, 0.5s, 0.75s 프레임 이격)에서 DOVER-Lap을 사용한 융합을 통해 투표 가중치(0.4, 0.3, 0.3)를 적용하여 정확성과 강인성을 향상시킨다.
실험 결과
연구 질문
- RQ1VoxConverse dev2 세트의 SNR 및 오디오 지속시간 분포가 VoxSRC-2021 평가 세트와 비교해 어떻게 유사한가? 이로 인해 모델의 일반화 능력에 영향을 미치는가?
- RQ2다양한 노이즈와 겹침 조건 하에서 다중 화자 분리 시스템에서 화자 임베딩 추출 및 클러스터링에 가장 적합한 시간 스케일은 무엇인가?
- RQ3자동 튜닝된 스펙트럼 클러스터링 및 VAD 필터링과 함께 AHC 기반 재클러스터링이 화자 분리 성능 향상에 기여하는가?
- RQ4다른 시간 스케일을 가진 시스템을 융합하는 데 DOVER-Lap 융합 방법이 DER 및 JER 감소에 얼마나 효과적인가?
- RQ5겹침 음성 감지 및 처리가 전체 화자 분리 성능에 얼마나 큰 영향을 미치는가?
주요 결과
- VoxConverse dev2 세트와 VoxSRC-2021 평가 세트는 SNR 및 지속시간 분포가 유사하여, dev2 세트를 주요 검증 세트로 사용하는 것이 타당하다고 판단된다.
- 최고의 단일 시스템(0.25s 프레임 이격)은 개발 세트에서 4.33% DER 및 23.80% JER를 기록했으며, 더 넓은 스케일 시스템보다 뛰어난 성능을 보였다.
- DOVER-Lap 융합을 통한 시스템 융합은 JER을 0.91% 감소시켜 16.02%로 개선했으며, 최고의 단일 시스템 대비 DER도 0.05% 향상시켜 평가 세트에서 5.15% DER을 달성했다.
- 임계치 0.047로 설정한 AHC 기반 재클러스터링은 특히 추정된 화자 수가 실제 수를 초과하는 경우에서 DER 향상에 크게 기여했다.
- 음성 강화 기법은 화자 임베딩을 악화시키는 것으로 나타나 DER에 악영향을 미치므로 최종 시스템에서 제외되었다.
- 겹침 음성 감지는 정밀도 76.85%, 재현도 36.81%를 기록했으며, 개발 세트의 3.28%만 겹침이 발생했고, 3명 이상의 화자가 겹치는 경우는 0.6%에 불과했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.