Skip to main content
QUICK REVIEW

[논문 리뷰] The DKU-DukeECE-Lenovo System for the Diarization Task of the 2021 VoxCeleb Speaker Recognition Challenge

Weiqing Wang, Danwei Cai|arXiv (Cornell University)|2021. 09. 05.
Speech Recognition and Synthesis참고 문헌 23인용 수 19
한 줄 요약

이 논문은 2021년 VoxCeleb 음성 인식 챌린지에 대비해 혼합형 화자 디아라이제이션 시스템을 제안하며, 음성 활성도 검출(VAD), 화자 임베딩, 클러스터링, 그리고 새로운 겹침 검출 방법을 통합한다. 주요 혁신은 두 명의 화자 간에 겹침 음성을 식별하는 2명의 화자 대상 음성 활성도 검출(TS-VAD) 모델로, 이는 잘못된 화자 누락 오류를 크게 줄이고 테스트 세트에서 5.07%의 디아라이제이션 오류율(DER)을 달성하여 챌린지에서 1위를 기록한다.

ABSTRACT

This report describes the submission of the DKU-DukeECE-Lenovo team to the VoxCeleb Speaker Recognition Challenge (VoxSRC) 2021 track 4. Our system including a voice activity detection (VAD) model, a speaker embedding model, two clustering-based speaker diarization systems with different similarity measurements, two different overlapped speech detection (OSD) models, and a target-speaker voice activity detection (TS-VAD) model. Our final submission, consisting of 5 independent systems, achieves a DER of 5.07% on the challenge test set.

연구 동기 및 목표

  • 실생활의 겹침 음성 상황에서 디아라이제이션 오류율(DER)을 줄이기 위해 겹침 검출을 향상시키는 것.
  • 기존 디아라이제이션 시스템이 겹침 음성을 탐지하지 못해 발생하는 화자 누락 오류를 해결하는 것.
  • 고정된 화자 수를 가정하지 않는 유연하고 화자에 종속되지 않는 겹침 검출 방법을 개발하는 것.
  • 다중 모델 융합과 데이터 증강을 통해 시스템의 강건성을 향상시키는 것.
  • 특히 겹침 음성을 다루는 데서 최신 기술 수준의 성능을 달성하기 위해 2021년 VoxSRC 챌린지에서 최고 성능을 내는 것.

제안 방법

  • VAD, 겹침 검출, TS-VAD에 대해 ResNet34-BiLSTM 아키텍처를 사용하며, 프레임 단위 음성 확률을 위한 통계적 풀링과 시그모이드 출력을 적용한다.
  • 2명의 화자에 대한 TS-VAD 모델을 제안하며, 화자 임베딩 쌍을 TS-VAD 네트워크에 입력하여 두 화자 간의 겹침 음성 영역을 검출함으로써 사전에 화자 수를 알지 못해도 검출이 가능하도록 한다.
  • 화자 임베딩는 전면에 ResNet34를 사용하고, 글로벌 통계 풀링과 ArcFace 손실을 적용하여 VoxCeleb 1 및 2에서 훈련하여 강건성을 확보한다.
  • 결합 계층 클러스터링(AHC)과 스펙트럼 클러스터링을 위한 LSTM 기반 유사도를 사용하며, DEV402에서 초모델 하이퍼파라미터를 튜닝한다.
  • TS-VAD에 대해 다단계 훈련 전략을 적용: 시뮬레이션된 Librispeech에서 사전 훈련, VoxConverse로 전이 학습, MUSAN과 RIRs를 사용한 데이터 증강을 통한 DEV402에서의 미세조정.
  • DOVER-Lap를 통한 시스템 융합과 순위 기반 가중치는 다섯 개의 독립 시스템을 융합하여 강건성과 최종 DER을 향상시킨다.

실험 결과

연구 질문

  • RQ1고정된 화자 수를 가정하지 않고도 어떤 화자 쌍 간의 겹침 음성 영역을 효과적으로 검출할 수 있는 2명의 화자 대상 TS-VAD 모델이 가능한가?
  • RQ2VAD, TS-VAD, 2명의 화자 TS-VAD와 같은 다수의 겹침 검출 방법을 융합하면 전체 디아라이제이션 성능가 개선되는가?
  • RQ3MUSAN과 RIRs를 사용한 데이터 증강이 실생활 디아라이제이션 환경에서 모델 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ4다양한 시스템을 융합한 DOVER-Lap 융합 기법이 개별 시스템보다 더 나은 일반화 능력과 낮은 DER을 달성하는가?
  • RQ5다단계 훈련 및 전이 학습 전략이 시뮬레이션된 데이터에서 실생활 데이터로의 TS-VAD 모델 적응에 효과적으로 기여하는가?

주요 결과

  • 제안된 2명의 화자 TS-VAD 모델은 어떤 화자 쌍 간의 겹침 음성도 성공적으로 검출하여 화자 수를 사전에 알지 못해도 검출이 가능하다.
  • DOVER-Lap를 통한 순위 기반 가중치 융합으로 다섯 개의 독립 모델을 융합한 최종 시스템은 VoxSRC 2021 테스트 세트에서 5.07%의 디아라이제이션 오류율(DER)을 달성하여 챌린지에서 1위를 기록했다.
  • 2명의 화자 TS-VAD 방법은 겹침 영역를 정확히 식별함으로써 화자 누락 오류를 줄였으며, 전체 성능 향상에 기여했다.
  • DOVER-Lap 융합은 강건성과 일반화 능력을 향상시켜 개별 시스템과 이전 융합 시도보다 우수한 성능을 보였으며, 검증 세트에서 과적합의 징후를 보이지 않았다.
  • 다단계 훈련 전략—Librispeech에서 사전 훈련, VoxConverse로 전이 학습, DEV402에서 데이터 증강을 통한 미세조정—을 통해 TS-VAD 모델이 실생활 조건에 효과적으로 적응할 수 있었다.
  • MUSAN과 RIRs를 사용한 데이터 증강은 다양한 음향 조건에서 모델의 강건성을 향상시켜 VAD 및 TS-VAD 모델에 특히 유익했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.