Skip to main content
QUICK REVIEW

[논문 리뷰] The xx205 System for the VoxCeleb Speaker Recognition Challenge 2020

Xu Xiang|arXiv (Cornell University)|2020. 10. 31.
Speech Recognition and Synthesis참고 문헌 17인용 수 8
한 줄 요약

이 논문은 VoxCeleb Speaker Recognition Challenge 2020의 두 트랙에서 모두 2위를 기록한 xx205 시스템을 제시한다. 이 시스템은 깊이 있는 CNN 아키텍처(ResNet, Res2Net, DPN), 임베딩의 분류 성능을 향상시키기 위한 복합 마진 소프트맥스 손실, 점수 정규화 및 시스템 융합을 활용하여, 코너디션 조건 트랙에서 EER 3.808% 및 minDCF 0.1958을 달성했으며, 오픈조건 트랙에서는 EER 3.798% 및 minDCF 0.1942를 기록하였다.

ABSTRACT

This report describes the systems submitted to the first and second tracks of the VoxCeleb Speaker Recognition Challenge (VoxSRC) 2020, which ranked second in both tracks. Three key points of the system pipeline are explored: (1) investigating multiple CNN architectures including ResNet, Res2Net and dual path network (DPN) to extract the x-vectors, (2) using a composite angular margin softmax loss to train the speaker models, and (3) applying score normalization and system fusion to boost the performance. Measured on the VoxSRC-20 Eval set, the best submitted systems achieve an EER of $3.808\%$ and a MinDCF of $0.1958$ in the close-condition track 1, and an EER of $3.798\%$ and a MinDCF of $0.1942$ in the open-condition track 2, respectively.

연구 동기 및 목표

  • 제한된 훈련 데이터 조건과 개방형 훈련 데이터 조건 하에서 VoxSRC 2020 챌린지에 대응하는 고성능 화자 인식 시스템을 개발하기 위해.
  • 화자 확인에서 x-vector 추출을 위한 다수의 깊이 학습 CNN 아키텍처—ResNet, Res2Net, DPN—의 성능 비교를 위해.
  • 두 개의 조절 가능한 마진을 가진 복합 마진 소프트맥스 손실 함수를 도입하여 모델의 일반화 능력과 분류 능력을 향상시키기 위해.
  • 점수 정규화 및 다수의 모델 융합을 통해 시스템의 강인성을 향상시키기 위해.
  • 도메인 이탈과 짧은 테스트 발화 조건에도 불구하고, 코너디션 및 오픈조건 평가 세트에서 최첨단 성능을 달성하기 위해.

제안 방법

  • 음성 활동 검출 없이, 3초 슬라이딩 윈도우 기반의 평균 정규화를 적용한 40차원 Fbank 특징을 사용한다.
  • x-vector 추출을 위한 다수의 CNN 아키텍처—ResNet, Res2Net, DPN—을 평가하였으며, DPN68가 가장 높은 성능을 기록하였다.
  • 복합 마진 소프트맥스(CM-Softmax) 손실을 사용하였으며, 수식은 $ L_{\text{CM}} = -\frac{1}{N}\sum_{i=1}^{N}\log\frac{e^{s(\cos(\theta_{y_i,i}+m_1)-m_2)}}{e^{s(\cos(\theta_{y_i,i}+m_1)-m_2)} + \sum_{j\neq i}e^{s\cos(\theta_{j,i})}} $ 로 정의되며, 여기서 $ m_1 $ 및 $ m_2 $ 는 학습 가능한 마진이다.
  • 데이터 증강에는 리버버브, MUSAN 노이즈, 음악, babel이 포함되어 있으며, 원본 발화당 4개의 추가 데이터 복제본을 생성한다.
  • 점수 정규화는 VoxCeleb2 및 VoxCelebCat의 코hort 세트를 사용한 적응형 대칭 정규화(s-norm)를 적용하며, 평균 및 표준편차 계산을 위해 상위 400명의 화자들을 선별한다.
  • 시스템 융합은 Bosaris 툴킷을 사용하여 다수의 모델에서 유도된 코사인 거리 및 PLDA 점수를 융합하며, x-vector에 대해 LDA 및 길이 정규화를 적용한다.

실험 결과

연구 질문

  • RQ1VoxSRC 2020 챌린지에서 화자 임베딩 추출에 있어 ResNet, Res2Net, DPN 등의 다양한 CNN 아키텍처가 어떤 성능을 보였는가?
  • RQ2두 개의 조절 가능한 마진을 가진 복합 마진 소프트맥스 손실을 사용할 경우 화자 모델의 분류 능력에 어떤 영향을 미치는가?
  • RQ3점수 정규화 및 모델 융합은 도메인 이탈과 짧은 발화 조건 하에서도 VoxSRC 2020 평가 세트에서 성능 향상에 얼마나 기여하는가?
  • RQ4트랙 2에서 Librispeech 데이터를 추가로 포함시키는 것은 트랙 1 대비 도메인 이탈과 짧은 테스트 발화 조건 하에서도 시스템의 강인성과 성능에 어떤 영향을 미치는가?
  • RQ5일관된 시스템 파이프라인을 통해 도메인 이탈이 최소화된 상태에서 코너디션 및 오픈조건 트랙에서 모두 최상위 성능을 달성할 수 있는가?

주요 결과

  • 트랙 1에서 가장 우수한 단일 시스템은 DPN68를 기반으로 하며, 구성 B+β+3를 사용하여 VoxSRC-20 Val 세트에서 EER 2.865% 및 minDCF 0.1422를 기록하였다.
  • 트랙 1의 최종 융합 시스템은 VoxSRC-20 Eval 세트에서 EER 3.808% 및 minDCF 0.1958을 기록하였으며, 코너디션 트랙에서 2위를 기록하였다.
  • 트랙 2에서는 가장 우수한 단일 시스템이 VoxSRC-20 Val 세트에서 EER 2.731% 및 minDCF 0.1427을 기록하였으며, 융합 시스템은 VoxSRC-20 Eval 세트에서 EER 3.798% 및 minDCF 0.1942를 기록하였다.
  • 트랙 2에서 추가로 Librispeech 데이터를 활용함으로써 도메인 이탈과 짧은 테스트 발화 조건에도 불구하고 성능 향상이 약간 발생하였다.
  • VoxCeleb2 및 VoxCelebCat의 상위 400명 화자 코hort를 사용한 적응형 s-norm를 통한 점수 정규화가 시스템의 강인성과 일반화 능력을 크게 향상시켰다.
  • 스케일링 인자 $ s = 32.0 $, $ m_1 = 0.2 $, $ m_2 = 0.1 $를 가진 복합 마진 소프트맥스 손실이 클래스 간 분離성 향상과 클래스 내 응집성 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.