Skip to main content
QUICK REVIEW

[논문 리뷰] The DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022

Xiaoyi Qin, Na Li|arXiv (Cornell University)|2022. 10. 11.
Speech Recognition and Synthesis인용 수 6
한 줄 요약

이 논문은 VoxCeleb Speaker Recognition Challenge 2022의 DKU-Tencent 시스템을 제시하며, 트랙1(크로스에이지 검증)에 대해 데이터 증강, 다중 백본 모델, 품질 인식 스코어 校정을 조합한 하이브리드 접근법을 제안하고, 트랙3에 대해 서브센터 아크페이스를 사용한 가짜 레이블 기반 준지도 학습 도메인 적응을 수행한다. 시스템은 트랙1에서 0.107 mDCF, 트랙3에서 7.135% EER을 기록하여 QMF 기반 校정과 강력한 훈련 프로토콜을 통해 뚜렷한 성능 향상을 보였다.

ABSTRACT

This paper is the system description of the DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC22). In this challenge, we focus on track1 and track3. For track1, multiple backbone networks are adopted to extract frame-level features. Since track1 focus on the cross-age scenarios, we adopt the cross-age trials and perform QMF to calibrate score. The magnitude-based quality measures achieve a large improvement. For track3, the semi-supervised domain adaptation task, the pseudo label method is adopted to make domain adaptation. Considering the noise labels in clustering, the ArcFace is replaced by Sub-center ArcFace. The final submission achieves 0.107 mDCF in task1 and 7.135% EER in task3.

연구 동기 및 목표

  • 트랙1에서 연령대 간 일반화를 향상시켜 크로스에이지 음성 인식 도전 과제를 해결한다.
  • 트랙3에서 레이블이 없는 타겟 도메인 데이터를 활용해 효과적인 준지도 학습 도메인 적응을 가능하게 한다.
  • 클러스터링 기반 도메인 적응에서 노이즈가 많은 가짜 레이블의 영향을 줄인다.
  • 품질 측정 함수(QMF)와 스코어 정규화를 통해 시스템의 강건성을 향상시킨다.
  • 완전 지도 학습 및 준지도 학습 트랙 모두에서 VoxCeleb2022 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • MUSAN 및 RIR 노이즈를 사용한 실시간 데이터 증강, 속도 변형 및 볼륨 변동을 통해 훈련 다양성을 증가시킨다.
  • 프레임 수준 특징 추출을 위해 SimAM-ResNet34, ResNet101, ResNet152, Res2Net101 등의 다수의 백본 네트워크를 사용하고, 세그먼트 수준 임베딩를 얻기 위해 통계, 표준편차 또는 주의 기반 통계 풀링을 적용한다.
  • 첫 번째 훈련 단계에서 마진 0.2, 스케일 32를 사용한 아크페이스 손실을 적용하고, 이후 마진을 0.5로 증가시키고 데이터 증강을 감소시킨 대규모 마진 미세조정(LMFT)을 수행한다.
  • 적응형 대칭 스코어 정규화(AS-Norm)와 음성 지속 시간 및 임베딩 크기 기반의 품질 측정 함수(QMF)를 사용해 스코어를 校정한다.
  • 트랙3에서는 K=1600–2000로 결정된 엣지 방법을 통해 레이블이 없는 타겟 데이터에 대해 K-평균 클러스터링을 수행해 가짜 레이블을 생성하고, 노이즈가 많은 레이블의 영향을 줄이기 위해 서브센터 아크페이스를 사용한다.
  • 최종 시스템은 8개의 다양한 아키텍처를 통합하고, 긴 발화는 20초로 잘라내며, 20,000개의 타겟 도메인 샘플을 기반으로 코hort 기반 정규화를 적용한다.

실험 결과

연구 질문

  • RQ1데이터 증강과 모델 아키텍처의 다양성은 어떻게 크로스에이지 음성 검증 성능을 향상시킬 수 있는가?
  • RQ2지속 시간과 크기 기반의 품질 측정 함수(QMF)는 크로스에이지 시나리오에서 스코어 校정을 얼마나 향상시킬 수 있는가?
  • RQ3클러스터링을 통한 가짜 레이블링이 준지도 학습 도메인 적응을 효과적으로 가능하게 할 수 있는가?
  • RQ4아크페이스를 서브센터 아크페이스로 대체하면 클러스터링 기반 적응에서 노이즈가 많은 가짜 레이블에 대한 민감도가 감소하는가?
  • RQ5크로스도메인 음성 인식 검증에서 일반화와 강건성을 균형 잡는 데 최적의 훈련 프로토콜은 무엇인가?

주요 결과

  • 기본 모델인 SimAM-ResNet34는 Vox-O에서 0.542% EER과 0.034 mDCF를 기록했지만, 평가 세트에서 성능이 크게 떨어져 도메인 이동 문제를 드러냈다.
  • QMF 기반 스코어 校정을 적용한 결과, Vox-CA 테스트 세트에서 mDCF가 0.263에서 0.139로 감소하여 상대적 개선률 30%를 기록했다.
  • 최종 융합 시스템은 트랙1 평가에서 0.107 mDCF를 기록하여 다중 모델 앙상블과 QMF 校정의 효과를 입증했다.
  • 트랙3에서 서브센터 아크페이스를 사용한 가짜 레이블링은 AS-Norm 및 QMF 적용 후 EER을 8.680%에서 8.090%로 감소시켜 노이즈 레이블에 대한 강건성을 입증했다.
  • 최종 시스템은 트랙3 평가 세트에서 7.135% EER을 기록했고, 제출 결과에서도 일관되게 7.153% EER를 기록하여 뛰어난 일반화 능력을 보였다.
  • 두 번째 라운드 미세조정은 성능을 떨어뜨렸기 때문에, 트랙3의 모든 모델에 대해 클러스터링과 미세조정을 한 번만 수행했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.