Skip to main content
QUICK REVIEW

[논문 리뷰] The Kriston AI System for the VoxCeleb Speaker Recognition Challenge 2022

Qutang Cai, Guoqiang Hong|arXiv (Cornell University)|2022. 09. 23.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 VoxCeleb Speaker Recognition Challenge 2022에 참가한 Kriston AI 시스템을 제시하며, 모든 세 개의 트랙에서 두 번째로 높은 성능을 기록했다. 이는 수정된 ResNet 아키텍처를 조합하고 가중치를 적용한 모델 앙상블을 통해 말하는 사람 식별(최소 minDCF 0.072, EER 1.119%)을 수행하고, 음성 활동 검출(VAD), 말하는 사람 임베딩 추출, 응집형 군집화, 베이지안 HMM 재군집화, 겹치는 음성 탐지 기법을 통합하여 다이아라이제이션을 수행함으로써 달성되었다( DER 4.86%).

ABSTRACT

This technical report describes our system for track 1, 2 and 4 of the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC-22). By combining several ResNet variants, our submission for track 1 attained a minDCF of 0:090 with EER 1:401%. By further incorporating three fine-tuned pre-trained models, our submission for track 2 achieved a minDCF of 0:072 with EER 1:119%. For track 4, our system consisted of voice activity detection (VAD), speaker embedding extraction, agglomerative hierarchical clustering (AHC) followed by a re-clustering step based on a Bayesian hidden Markov model and overlapped speech detection and handling. Our submission for track 4 achieved a diarisation error rate (DER) of 4.86%. The submissions all ranked the 2nd places for the corresponding tracks.

연구 동기 및 목표

  • 다양한 딥 러닝 아키텍처를 활용하여 VoxSRC-22 챌린지에 대응하는 강력한 말하는 사람 식별 및 다이아라이제이션 시스템을 개발하기 위해.
  • 다양한 수정된 ResNet 변종을 가중치 기반 융합 방식으로 조합하여 말하는 사람 식별 작업의 성능을 향상시키기 위해.
  • 음성 활동 검출, 말하는 사람 임베딩 군집화, 겹치는 음성 처리 기법을 통합하여 다이아라이제이션 정확도를 향상시키기 위해.
  • 사전 훈련된 모델과 데이터 증강 기법을 활용하여 오픈셋 도전 과제(트랙 2 및 4)에서의 성능을 향상시키기 위해.
  • 검증 세트와 테스트 세트 간 성능 격차가 최소한이 되도록 VoxSRC-22 기준 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 모델 다양성을 확보하기 위해 입력 차원, 깊이, 커널 크기, 주의 메커니즘, 대체 내림샘플링 전략을 조정한 6종의 수정된 ResNet 변종을 VoxCeleb2 dev 세트에서 훈련함.
  • 말하는 사람 임베딩 모델링에서 헤드 간 상호작용을 향상시키기 위해 셔플드 멀티헤드 어텐션(SMHA) 풀링을 제안함.
  • 개별 모델을 가중치 기반 선형 조합으로 융합하였으며, 트랙 2에서는 ResNet 모델에 대해 가중치를 1로 설정하고, 사전 훈련된 모델에 대해 1,1,2로 수동 조정함.
  • 코호트 기반 AS-Norm를 사용한 점수 정규화와 VoxCeleb1-H에서의 로지스틱 회귀 캘리브레이션을 적용함.
  • VAD(융합된 FBank, MFCC, pyannote 모델), 1.5초 슬라이딩 윈도우 기반 말하는 사람 임베딩 추출, AHC 군집화, 수정된 방정식을 적용한 VB-HMM 재군집화를 결합한 다이아라이제이션 파이프라인을 구축함.
  • VAD와 유사한 모델을 활용하여 겹치는 음성 탐지 기능을 통합하였으며, 후처리를 통해 가장 가까운 말하는 사람 쌍을 식별하고 충돌을 해결함.

실험 결과

연구 질문

  • RQ1다양한 ResNet 변종의 모델 앙상블 융합 전략이 폐쇄형 도전 과제에서 말하는 사람 식별 성능 향상에 얼마나 효과적인가?
  • RQ2사전 훈련된 모델을 미세조정하여 사용할 경우, 초기 학습에서부터 훈련하는 것과 비교해 오픈셋 말하는 사람 식별(트랙 2)에서 성능 향상 정도는 어느 정도인가?
  • RQ3VAD, 군집화, 베이지안 HMM 재군집화를 융합한 하이브리드 다이아라이제이션 시스템이 실제 환경에서의 노이즈 및 겹치는 음성 상황에서 다이아라이제이션 오류율(DER)을 줄이는 데 얼마나 효과적인가?
  • RQ4겹치는 음성 탐지 및 처리 기능을 통합할 경우, 실제 환경에서의 말하는 사람 다이아라이제이션의 강인성은 어떻게 향상되는가?
  • RQ5점수 정규화 및 캘리브레이션 기법이 말하는 사람 식별 과제에서 최종 시스템 성능에 미치는 영향은 무엇인가?

주요 결과

  • 융합 시스템은 트랙 1에서 minDCF 0.090, EER 1.401%를 기록하여, 오직 VoxCeleb2 dev 데이터만을 사용함에도 불구하고 폐쇄형 도전 과제에서 뛰어난 성능을 보였다.
  • 세 개의 미세조정된 사전 훈련된 모델을 통합함으로써, 트랙 2에서 minDCF 0.072, EER 1.119%를 달성하여 오픈셋 데이터에서의 일반화 능력이 향상되었고, 두 번째로 높은 순위를 기록함.
  • 다이아라이제이션 시스템은 평가 세트에서 DER 4.86%, JER 25.48%를 기록하였으며, 최적의 구성(VB+asnorm)이 기본 VB 대비 DER을 0.13% 감소시켜 성능 향상을 입증함.
  • VAD 융합 시스템은 트랙 4-dev2에서 정확도 95.37%, FA 3.55%, MISS 1.06%를 기록하여 강력한 음성 활동 검출 성능을 입증함.
  • 수정된 VB-HMM 방정식 (2) 및 (3)을 적용한 재군집화 단계는 표준 VB-HMM 대비 DER을 0.13% 향상시켜, 제안된 사후 확률 모델링의 효과성을 입증함.
  • 검증 세트와 테스트 세트 간 성능 격차가 최소한이었으며, 일관된 성능 유지로 인해 강력한 일반화 능력과 강인성을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.