Skip to main content
QUICK REVIEW

[논문 리뷰] SJTU-AISPEECH System for VoxCeleb Speaker Recognition Challenge 2022

Zhengyang Chen, Bing Han|arXiv (Cornell University)|2022. 09. 19.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 VoxCeleb Speaker Recognition Challenge 2022의 SJTU-AISPEECH 시스템을 제시하며, 자기지도 및 준지도 목표를 활용하여 공동으로 훈련된 소스 도메인 및 타겟 도메인 데이터를 사용한 도메인 적응 전략을 도입한다. 시스템은 동적 손실 게이트 및 레이블 보정(DLG-LC)을 활용하여 가짜 레이블을 정교화하며, 융합 모델을 통해 트랙1에서 3위, 트랙3에서 4위를 기록한다.

ABSTRACT

This report describes the SJTU-AISPEECH system for the Voxceleb Speaker Recognition Challenge 2022. For track1, we implemented two kinds of systems, the online system and the offline system. Different ResNet-based backbones and loss functions are explored. Our final fusion system achieved 3rd place in track1. For track3, we implemented statistic adaptation and jointly training based domain adaptation. In the jointly training based domain adaptation, we jointly trained the source and target domain dataset with different training objectives to do the domain adaptation. We explored two different training objectives for target domain data, self-supervised learning based angular proto-typical loss and semi-supervised learning based classification loss with estimated pseudo labels. Besides, we used the dynamic loss-gate and label correction (DLG-LC) strategy to improve the quality of pseudo labels when the target domain objective is a classification loss. Our final fusion system achieved 4th place (very close to 3rd place, relatively less than 1%) in track3.

연구 동기 및 목표

  • 도메인 이동 조건에서 특히 강건한 말하기 검증 시스템을 개발하기 위해.
  • 타겟 도메인 데이터에 대해 자기지도 및 준지도 훈련 목표를 활용하여 트랙3의 제로샷 도메인 적응 성능을 향상시키기 위해.
  • 약한 지도 학습 설정에서 동적 손실 게이트 및 레이블 보정(DLG-LC) 전략을 사용하여 가짜 레이블 품질을 향상시키기 위해.
  • 모델 융합을 통해 폐쇄 집합(트랙1) 및 개방 집합 도메인 적응(트랙3) 트랙에서 최신 기술 성능을 달성하기 위해.
  • 감독 학습 및 도메인 적응 상황에서 다양한 ResNet 기반 백본과 손실 함수의 영향을 조사하기 위해.

제안 방법

  • 트랙1에 대해 두 가지 시스템을 구현: 실시간 데이터 증강을 사용하는 온라인 시스템과 속도 왜곡 및 노이즈/반사음을 활용한 광범위한 사전 증강 데이터를 사용하는 오프라인 시스템.
  • 온라인 시스템에는 ResNet 및 Res2Net 백본을 사용하고, 다중 쿼리 다중 헤드 어텐션 풀링(MQMHA)을 적용하며, 오프라인 시스템에는 통계 풀링을 사용한다.
  • 다단계 훈련을 적용: 온라인 시스템은 AAM + K-서브센터 + 상호-TopK 손실로 사전 훈련한 후, 증가된 마진을 사용한 큰 마진 미세조정을 수행하고, 오프라인 시스템은 AM + K-서브센터로 사전 훈련한다.
  • 트랙3에서는 통계 적응을 적용하고, 소스 도메인 및 타겟 도메인 데이터를 함께 훈련하며, 두 가지 목표를 사용한다: 각도 기반 원형 손실(자기지도)과 가짜 레이블을 사용한 분류 손실.
  • 준지도 훈련 중 노이즈가 섞인 가짜 레이블을 걸러내기 위해 동적 손실 게이트 및 레이블 보정(DLG-LC) 전략을 도입하여 레이블 품질을 향상시켰다.
  • 다양한 백본과 적응 전략에서 유도된 여러 모델을 융합하여 최종 제출을 수행하였으며, 코사인 스코어링, 적응형 스코어 정규화 및 스코어 校정을 사용하였다.

실험 결과

연구 질문

  • RQ1폐쇄 집합 말하기 검증(트랙1)에서 다양한 ResNet 기반 백본과 손실 함수는 성능에 어떤 영향을 미치는가?
  • RQ2다른 목표를 사용하여 소스 도메인 및 타겟 도메인 데이터를 공동으로 훈련하면 말하기 식별에서 도메인 적응 성능 향상에 기여하는가?
  • RQ3준지도 도메인 적응 중 가짜 레이블 품질 향상에 대해 DLG-LC 전략은 얼마나 효과적인가?
  • RQ4다양한 도메인 간 공동 훈련에 대해 단일 분류 헤드를 사용하는 것이 다수 헤드보다 더 우수한 분류 임베딩를 생성하는가?
  • RQ5통계 적응, as-norm, 스코어 校정과 같은 백엔드 처리 방법이 도메인 적응 성능에 어떤 영향을 미치는가?

주요 결과

  • 온라인 시스템(0.1375)과 유사한 EER을 유지하면서 오프라인 시스템이 더 낮은 minDCF(0.1029)를 기록하여 데이터 증강이 성능 향상에 기여함을 시사한다.
  • 일곱 개의 시스템 융합이 트랙1 검증 세트에서 EER 1.457% 및 minDCF 0.1029를 기록하여 3위를 확보하였다.
  • 한 개의 분류 헤드를 사용하는 OCL 전략이 두 개의 헤드를 사용하는 TCL 전략보다 우수하여 트랙3에서 EER 8.095% 및 minDCF 0.3696를 기록하였다.
  • DLG-LC 전략은 TCL 방법을 크게 향상시켜 EER를 9.320%에서 9.060%로 감소시키고, minDCF를 0.4254에서 0.4180으로 개선했다.
  • 최종 융합 시스템은 트랙3 검증 세트에서 EER 7.135% 및 minDCF 0.3290를 기록하여 4위를 기록하였으며, 3위와 1% 이내의 성능 차이를 보였다.
  • 스코어 校정은 EER을 9.950%로 감소시켰지만 minDCF를 악화시켜 지표 간 상충 관계를 보였다. 따라서 최종 제출에서는 as-norm와 스코어 校정을 함께 사용하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.