[논문 리뷰] The DKU-DukeECE Diarization System for the VoxCeleb Speaker Recognition Challenge 2022
이 논문은 VoxCeleb Speaker Recognition Challenge 2022, Track 4에서 1위를 차지한 DKU-DukeECE 시스템을 제시한다. 이 시스템은 다중 모델 음성 활성 검출(VAD), 대상 발화자 VAD(TS-VAD) 및 개선된 발화자 임베딩 모델을 집합적 계층적 군집화(AHC) 프레임워크 내에서 융합하여 4.75%의 다이아라이제이션 오류율(DER)을 달성한다. DOVER-Lap 융합을 통해 네 가지 다른 설정을 활용함으로써, 향상된 VAD 및 오버랩 처리를 통해 DER를 크게 감소시켰다.
This paper discribes the DKU-DukeECE submission to the 4th track of the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC-22). Our system contains a fused voice activity detection model, a clustering-based diarization model, and a target-speaker voice activity detection-based overlap detection model. Overall, the submitted system is similar to our previous year's system in VoxSRC-21. The difference is that we use a much better speaker embedding and a fused voice activity detection, which significantly improves the performance. Finally, we fuse 4 different systems using DOVER-lap and achieve 4.75 of the diarization error rate, which ranks the 1st place in track 4.
연구 동기 및 목표
- 다중 발화자 및 오버랩된 음성 상황에서 강력한 음성 활성 검출(VAD) 및 오버랩 검출을 통해 발화자 다이아라이제이션 성능을 향상시키기.
- VAD 모델을 향상시키고 대상 발화자 VAD(TS-VAD)를 통합하여 오버랩 영역 검출을 향상시킴으로써 다이아라이제이션 오류율(DER)을 감소시키기.
- 학습 데이터(VoxCeleb)와 테스트 데이터(VoxConverse) 간의 도메인 불일치를 제거하기 위해 발화자 임베딩의 편향 레이블링 및 피니어튜닝을 통해 성능 향상시키기.
- DOVER-Lap를 통한 다수의 다이아라이제이션 시스템 융합을 통해 시스템의 강건성과 일반화 능력을 향상시키기.
- VoxSRC 2022 Speaker Recognition Challenge, Track 4에서 최신 기술 수준의 성능을 달성하기.
제안 방법
- 다양한 VAD 모델 네 가지—ResNet34 기반, Conformer 기반, pyannote.audio 2.0, ASR 기반—을 주로 투표 방식으로 융합하여 잘못된 경고 및 누락 검출을 줄이기.
- SimAM-ResNet34 기반의 발화자 임베딩 모델을 ArcFace 손실과 함께 사용하고, 도메인 갭을 줄이기 위해 편향 레이블링된 VoxConverse 개발 세트를 사용해 피니어튜닝을 수행하기.
- 특정 대상 발화자의 음성 세그먼트를 검출하기 위해 발화자 임베딩을 사용하는 대상 발화자 VAD(TS-VAD) 모델을 도입하였으며, 시뮬레이션된 Librispeech 데이터로 학습하고 VoxConverse에서 피니어튜닝을 수행하였다.
- DOVER-Lap 융합을 통해 네 가지 시스템 버전을 통합: 오버랩 검출이 있는 AHC, 부분/전체 할당된 TS-VAD가 있는 AHC, TS-VAD가 있는 LSTM 기반 스펙트럼 군집화.
- MUSAN 및 RIRs를 사용한 온라인 데이터 증강을 적용하여 다양한 음향 조건에서의 강건성을 향상시키기.
- 하이브리드 추론 전략을 적용: AHC 기반 결과에 대해 TS-VAD 출력을 부분적으로 활용하여 발화자 혼동과 과도한 추정을 줄이기.
실험 결과
연구 질문
- RQ1다양한 VAD 모델을 효과적으로 융합하여 다중 발화자 상황에서 다이아라이제이션 오류율(DER)을 감소시킬 수 있는가?
- RQ2기본 VAD 또는 오버랩 전용 검출 대비, 대상 발화자 VAD(TS-VAD)는 오버랩 검출 및 전체 다이아라이제이션 성능을 얼마나 향상시키는가?
- RQ3VoxCeleb에서 사전 학습된 발화자 임베딩 모델을 VoxConverse 테스트 세트에 효과적으로 적응시켜 도메인 불일치를 줄이고 DER를 향상시킬 수 있는가?
- RQ4다양한 다이아라이제이션 시스템의 DOVER-Lap 융합은 발화자 혼동과 과도한 추정이 존재하는 상황에서 강건성과 DER 저감에 어떻게 기여하는가?
- RQ5MUSAN 및 RIRs를 사용한 데이터 증강은 VAD 및 다이아라이제이션 모델의 일반화 능력에 어떤 영향을 미치는가?
주요 결과
- 융합된 VAD 시스템은 개별 VAD 모델 대비 DER을 0.3% 감소시켜 VoxConverse 테스트 세트에서 3.97%의 오류율을 달성하였다.
- TS-VAD가 포함된 AHC 기반 다이아라이제이션 시스템은 VoxConverse 및 챌린지 테스트 세트에서 각각 4.85%의 DER을 기록하여 랭킹에서 1위를 차지하였다.
- 네 가지 다른 시스템을 DOVER-Lap 융합하여 DER을 4.75%로 감소시켜 VoxSRC 2022 Track 4에서 1위를 확보하였다.
- TS-VAD 모델은 기준 AHC에 비해 약 0.6%의 DER 감소를 이끌어내어 오버랩 음성 처리에서의 효과성을 입증하였다.
- AHC 전용 베이스라인은 발화자 수를 과도하게 추정하는 경향(예: 10명의 발화자 세그먼트에 대해 30명 이상 예측)이 있었지만, 부분적인 TS-VAD 할당을 통해 오류를 수정함으로써 시스템이 크게 향상되었다.
- VoxConverse에서의 피니어튜닝에도 불구하고, 발화자 임베딩 모델은 챌린지 테스트 세트에서 사전 학습된 VoxCeleb2 모델보다 성능이 열 劣하였고, 최종 추론에는 후자를 사용하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.