Skip to main content
QUICK REVIEW

[논문 리뷰] The DKU-DukeECE System for the Self-Supervision Speaker Verification Task of the 2021 VoxCeleb Speaker Recognition Challenge

Danwei Cai, Ming Li|arXiv (Cornell University)|2021. 09. 07.
Speech Recognition and Synthesis참고 문헌 22인용 수 10
한 줄 요약

이 논문은 2021년 VoxCeleb 스피커 인식 챌린지에 대비해 DKU-DukeECE 시스템을 제안하며, 클러스터 앙상블을 통해 융합된 음성 및 시각적 가짜 레이블을 활용하는 반복적이고 다중 모odal 자기 지율 프레임워크를 도입하여 스피커 표현 학습을 향상시킨다. 이 방법은 개발 세트에서 5.58%의 EER을 기록했고, 테스트 세트에서는 5.59%를 기록하여 반복적 가짜 레이블링과 다중 모odal 지식 정복이 자기 지율 스피커 검증에 효과적임을 입증한다.

ABSTRACT

This report describes the submission of the DKU-DukeECE team to the self-supervision speaker verification task of the 2021 VoxCeleb Speaker Recognition Challenge (VoxSRC). Our method employs an iterative labeling framework to learn self-supervised speaker representation based on a deep neural network (DNN). The framework starts with training a self-supervision speaker embedding network by maximizing agreement between different segments within an utterance via a contrastive loss. Taking advantage of DNN's ability to learn from data with label noise, we propose to cluster the speaker embedding obtained from the previous speaker network and use the subsequent class assignments as pseudo labels to train a new DNN. Moreover, we iteratively train the speaker network with pseudo labels generated from the previous step to bootstrap the discriminative power of a DNN. Also, visual modal data is incorporated in this self-labeling framework. The visual pseudo label and the audio pseudo label are fused with a cluster ensemble algorithm to generate a robust supervisory signal for representation learning. Our submission achieves an equal error rate (EER) of 5.58% and 5.59% on the challenge development and test set, respectively.

연구 동기 및 목표

  • 반복적 가짜 레이블링을 통해 음성-시각 데이터를 활용하여 자기 지율 스피커 검증을 향상시키기.
  • 클러스터 앙상블 알고리즘을 사용해 음성과 시각적 가짜 레이블을 융합하여 분류 성능 향상에 기여하는 스피커 표현 학습을 강화하기.
  • 반복적인 가짜 레이블 개선을 통해 모델 성능을 향상시켜 수동 레이블링 의존도를 줄이기.
  • 자기 지율 학습에서 음성과 시각 모달 간의 상호보완적 이점을 탐색하기.
  • 자기 지율 스피커 검증 과제에서 최신 기술 수준의 성능을 달성하기.

제안 방법

  • 프레임워크는 증강된 시각을 활용한 인스턴스 구분 기반 대비 자기 지율 학습(CSL)을 음성 데이터에 적용하여 음성 인코더를 사전 학습한다.
  • 사전 학습된 모델의 음성 표현을 k-means를 사용해 클러스터링하여 감독 학습을 위한 초기 가짜 레이블을 생성한다.
  • 음성 클러스터링에서 유도된 가짜 레이블을 사용해 시각 인코더를 학습하고, 시각 표현도 유사하게 클러스터링하여 시각적 가짜 레이블을 생성한다.
  • 클러스터 앙상블 알고리즘을 사용해 음성 및 시각적 가짜 레이블을 융합하여 표현 학습을 위한 강력한 통합 지도 신호를 생성한다.
  • 이전 라운드에서 업데이트된 가짜 레이블을 사용해 반복적으로 스피커 및 얼굴 표현 네트워크를 재학습함으로써 표현을 개선한다.
  • 최종 모델은 레이블 스무딩, Squeeze-Excitation 모듈, AAM-softmax 손실을 적용하고, 점수는 적응형 대칭 점수 정규화(AS-Norm)를 사용해 정규화한다.

실험 결과

연구 질문

  • RQ1다중 모달 데이터를 활용한 반복적 가짜 레이블링이 대비 사전 학습을 초월해 자기 지율 스피커 표현 학습을 향상시킬 수 있는가?
  • RQ2클러스터 앙상블을 통한 음성 및 시각적 가짜 레이블 융합이 스피커 검증의 강건성과 정확도를 어떻게 향상시키는가?
  • RQ3자기 지율 모델이 노이즈가 있는 가짜 레이블을 반복적으로 개선함으로써 스스로 분류 능력을 강화할 수 있는 정도는 어느 정도인가?
  • RQ4음성 데이터가 제한되거나 노이즈가 많을 경우 시각 모달이 스피커 임베딩 품질 향상에 기여하는 정도는 어떠한가?
  • RQ5단일 모달 자기 지율과 비교했을 때 다중 모달 가짜 레이블 융합이 EER과 클러스터링 품질 측면에서 어떤 차이를 보이는가?

주요 결과

  • 시스템은 VoxSRC 2021 개발 세트에서 5.58%의 동일 오류율(EER)을 기록했고, 테스트 세트에서는 5.59%를 기록하여 뛰어난 일반화 능력을 입증했다.
  • 네 번의 반복적 라운드 후 음성 클러스터링 NMI는 0.95196에 도달하여 스피커 구조를 잘 반영한 고품질의 가짜 레이블임을 시사한다.
  • 네 번의 반복 후 시각 클러스터링 NMI는 0.95462에 도달하여 음성 유도 가짜 레이블을 기반으로 한 시각적 스피커 표현 학습이 효과적임을 보였다.
  • 융합된 가짜 레이블의 NMI는 0.95862에 도달하여 클러스터 앙상블이 양 모달 간 상호보완적 정보를 효과적으로 통합함을 입증했다.
  • 최종 융합 시스템은 점수 정규화 후 개발 세트에서 minDCF 0.315, EER 5.578%를 기록했고, 테스트 세트에서는 EER 5.594%를 기록했다.
  • 최종 시스템에서 Squeeze-Excitation 모듈과 AAM-softmax 손실을 사용함으로써 성능 향상이 더욱 뚜렷해졌으며, 이는 가짜 레이블 데이터에 대한 아키텍처 개선의 유용성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.