Skip to main content
QUICK REVIEW

[논문 리뷰] The DKU-MSXF Speaker Verification System for the VoxCeleb Speaker Recognition Challenge 2023

Ze Li, Yuke Lin|arXiv (Cornell University)|2023. 08. 17.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 VoxCeleb Speaker Recognition Challenge 2023의 DKU-MSXF 시스템을 제시하며, 완전히 지도 학습 트랙에서 성능 향상을 위해 교차 연령 QMF 훈련 전략을 도입하고, 트랙 3의 준지도 학습 도메인 적응을 위해 삼중 임계값과 부분 중심 정제를 활용한 새로운 가짜 레이블링 방법을 제안한다. 시스템은 mDCF 0.1243(트랙 1), 0.1165(트랙 2), EER 4.952%(트랙 3)를 달성하였다.

ABSTRACT

This paper is the system description of the DKU-MSXF System for the track1, track2 and track3 of the VoxCeleb Speaker Recognition Challenge 2023 (VoxSRC-23). For Track 1, we utilize a network structure based on ResNet for training. By constructing a cross-age QMF training set, we achieve a substantial improvement in system performance. For Track 2, we inherite the pre-trained model from Track 1 and conducte mixed training by incorporating the VoxBlink-clean dataset. In comparison to Track 1, the models incorporating VoxBlink-clean data exhibit a performance improvement by more than 10% relatively. For Track3, the semi-supervised domain adaptation task, a novel pseudo-labeling method based on triple thresholds and sub-center purification is adopted to make domain adaptation. The final submission achieves mDCF of 0.1243 in task1, mDCF of 0.1165 in Track 2 and EER of 4.952% in Track 3.

연구 동기 및 목표

  • 교차 연령 데이터 증강을 통해 완전히 지도 학습 설정에서 발화자 확인 성능을 향상시키기 위해.
  • 혼합 미세조정을 통해 대규모 VoxBlink-clean 데이터셋을 통합하여 모델의 일반화 능력을 향상시키기 위해.
  • 임계값 기반 클러스터링과 부분 중심 정제를 활용한 새로운 가짜 레이블링 전략을 통해 준지도 학습 발화자 확인에서 도메인 이동 문제를 해결하기 위해.
  • VoxCeleb Speaker Recognition Challenge 2023의 트랙 1, 2, 3에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 발화자 임베딩 추출을 위해 SimAM 및 fwSE 모듈을 갖춘 ResNet100 기반 백본을 사용한다.
  • 트랙 1에서 연령대 간 일반화를 향상시키기 위해 교차 연령 QMF 훈련을 적용한다.
  • 트랙 2에서는 VoxCeleb2 및 VoxBlink-clean 데이터를 모두 사용하여 혼합 미세조정(Mix-FT)을 적용한다.
  • 세 단계로 구성된 가짜 레이블링 파이프라인을 제안한다: T1을 사용한 KNN 그래프 구축, T2를 사용한 클래스 순수도 추정, T3를 사용한 클래스 융합.
  • 부분 중심 ArcFace 분류기에서의 선택 확률을 분석하여 낮은 순수도 클래스를 제거하기 위해 부분 중심 정제를 적용한다.
  • QMF와 20,000개의 레이블이 없는 타겟 도메인 발화자 집합을 활용하여 점수 校정 및 정규화를 수행한다.

실험 결과

연구 질문

  • RQ1교차 연령 QMF 훈련은 완전히 지도 학습 설정에서 발화자 확인 성능에 어떻게 기여하는가?
  • RQ2혼합 미세조정을 통해 VoxBlink-clean 데이터셋을 통합할 경우, 모델의 강건성과 정확도는 어느 정도 향상되는가?
  • RQ3임계값 기반 가짜 레이블링 전략과 부분 중심 정제를 활용한 방법은 준지도 학습 발화자 확인에서 도메인 이동 문제를 효과적으로 다룰 수 있는가?
  • RQ4제안된 방법은 VoxSRC-2023 챌린지에서 이전 접근법과 비교해 볼 때, 특히 트랙 3에서 어떻게 성능을 내는가?

주요 결과

  • DKU-MSXF 시스템은 트랙 1 평가 세트에서 mDCF 0.1243을 달성하여 기준 시스템에 비해 뚜렷한 성능 향상을 보였다.
  • 트랙 2에서는 mDCF 0.1165를 달성하여 트랙 1 기준 시스템 대비 약 10% 이상의 상대적 성능 향상을 보였다.
  • 트랙 3에서는 공식 평가 세트에서 EER 4.952%를 달성하여 지난해 첫 번째 등수 성과(7.03% EER)를 초월하였다.
  • 트랙 1 및 트랙 2에서 다수의 모델 융합을 통해 검증 세트에서 EER이 각각 2.079% 및 2.029%로 감소하였다.
  • 부분 중심 정제 단계는 노이즈가 많은 클래스 할당을 효과적으로 줄여 준지, 준지도 학습 훈련에서 가짜 레이블 데이터의 신뢰도를 향상시켰다.
  • VoxBlink-clean 데이터를 혼합 미세조정(Mix-FT)으로 통합함으로써 트랙 2에서 초기 학습 대비 10% 이상의 상대적 성능 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.