Skip to main content
QUICK REVIEW

[논문 리뷰] The DKU-DukeECE Systems for VoxCeleb Speaker Recognition Challenge 2020

Weiqing Wang, Danwei Cai|arXiv (Cornell University)|2020. 10. 24.
Speech Recognition and Synthesis참고 문헌 27인용 수 22
한 줄 요약

이 논문은 VoxCeleb 2020 스피커 인식 챌린지에 대비해 DKU-DukeECE 시스템을 제안하며, 고도화된 스피커 인식 및 다이아라이제이션 파이프라인을 소개한다. 트랙 1에서는 ResNet, ResNet-BAM, ECAPA-TDNN를 스코어 정규화 및 융합을 통해 조합하여 VoxSRC20-dev에서 2.48%의 EER을 달성한다. 트랙 4에서는 반복적 자기지도 학습, VAD, 균일한 세그먼테이션, 자기주의 기반 유사도 모델링 및 스펙트럼 클러스터링을 적용하여, 피니튜닝 이후 dev-66에서 DER을 6.46%로 감소시키고 JER을 28.58%로 낮춘다.

ABSTRACT

In this paper, we present the system submission for the VoxCeleb Speaker Recognition Challenge 2020 (VoxSRC-20) by the DKU-DukeECE team. For track 1, we explore various kinds of state-of-the-art front-end extractors with different pooling layers and objective loss functions. For track 3, we employ an iterative framework for self-supervised speaker representation learning based on a deep neural network (DNN). For track 4, we investigate the whole system pipeline for speaker diarization, including voice activity detection (VAD), uniform segmentation, speaker embedding extraction, and clustering.

연구 동기 및 목표

  • VoxCeleb 스피커 인식 챌린지 2020에 대비한 고성능 스피커 인식 및 다이아라이제이션 시스템 개발.
  • 노이즈, 반향, 속도 변형과 같은 데이터 증강 기법을 통한 강인성 및 일반화 능력 향상.
  • 트랙 3에서 저자원 환경에서의 스피커 표현 학습을 위한 반복적 자기지도 학습 탐색.
  • VAD, 세그먼테이션, 임베딩 추출, 유사도 모델링, 클러스터링을 포함한 전체 다이아라이제이션 파이프라인 최적화.
  • 엔드 투 엔드 시스템 통합 및 피니튜닝을 통해 VoxCeleb 및 VoxConverse 개발 세트에서 최신 기술 성능 달성.

제안 방법

  • 트랙 1에서는 80차원의 로그 멜 필터뱅크 특징, 글로벌 통계 풀링, ArcFace 손실을 사용하여 스피커 임베딩 학습을 위한 ResNet, ResNet-BAM, ECAPA-TDNN를 사용한다.
  • 시스템은 적응형 대칭 스코어 정규화(AS-Norm)와 캘리브레이션된 가중치(1, 1.2, 1)를 사용한 스코어 수준 융합을 적용하여 ResNet, ResNet-BAM, ECAPA-TDNN의 성능을 통합한다.
  • 트랙 3에서는 클러스터링 결과로부터 생성된 가짜 레이블을 사용해 DNN을 훈련하는 반복적 자기지도 학습 프레임워크를 적용하여 다수의 라운드 동안 스피커 임베딩을 향상시킨다.
  • 트랙 4에서는 균일한 세그먼테이션(1.5초, 0.75초 이격), 소프트맥스 손실을 사용한 ResNet 기반 스피커 임베딩 추출, 그리고 자기주의 기반 유사도 모델링을 통해 유사도 행렬을 계산한다.
  • 유사도 모듈은 256차원 입력, 128차원 헤드, 1024차원 피드포워드 레이어를 갖춘 멀티헤드 어텐션 네트워크를 사용하며, 시그모이드 스케일링된 유사도 점수를 출력한다.
  • 대칭화 및 정규화된 유사도 행렬을 사용한 스펙트럼 클러스터링을 다이아라이제이션에 적용하며, 0.99 임계값을 통해 스피커 수를 추정한다.

실험 결과

연구 질문

  • RQ1다양한 테스트 조건에서 ResNet, ResNet-BAM, ECAPA-TDNN 등의 다양한 프론트엔드 추출기 간의 스피커 인식 성능 비교는 어떻게 이루어지는가?
  • RQ2가짜 레이블 기반 반복적 자기지도 학습이 저자원 환경에서의 스피커 표현 학습에 효과적인가?
  • RQ3자기주의 기반 유사도 모델링은 짧은 세그먼트 간의 스피커 관계를 다이아라이제이션에 효과적으로 포착할 수 있는가?
  • RQ4VAD, 유사도, 겹침 탐지 모델의 피니튜닝이 다이아라이제이션 성능에 미치는 영향은 어떠한가?
  • RQ5VAD, 세그먼테이션, 임베딩, 유사도, 클러스터링을 통합한 유일한 파이프라인은 VoxConverse에서 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • ResNet, ResNet-BAM, ECAPA-TDNN의 융합 시스템은 VoxSRC20-dev 세트에서 2.48%의 EER과 0.1252 mDCF 0.05를 기록하여 개별 모델을 모두 초월한다.
  • 트랙 3에서의 반복적 자기지도 학습은 두 라운드 후 VoxCeleb1-H에서 minDCF를 0.857에서 0.479로, EER을 20.11%에서 9.60%로 감소시켰다.
  • 150개의 개발 레코딩에 대해 피니튜닝을 수행한 후, 다이아라이제이션 시스템은 개발 세트의 마지막 66개 레코드에서 6.46%의 DER과 28.58%의 JER을 달성했다.
  • 피니튜닝 없이 전체 개발 세트(dev-all)에서 DER은 9.74%였으나, 보류된 서브셋에 대해 피니튜닝을 수행한 후 6.46%로 향상되었다.
  • 자기주의 유사도 모델링은 유사도 추정을 크게 향상시켜, 다양한 세그먼트 길이 조건에서도 정확한 스피커 클러스터링을 가능하게 하였다.
  • 경계 연장 기반 겹침 탐지 기법은 강인성을 향상시켜, 피니튜닝 후 dev-66에서 JER을 15.7%로 낮추었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.