[논문 리뷰] UNISOUND System for VoxCeleb Speaker Recognition Challenge 2023
이 논문은 VoxSRC 2023 음성인식 도전 대회에서 트랙 1에서 1위, 트랙 2에서 2위를 기록한 UNISOUND 시스템을 제시한다. 임베딩의 안정성에 기반한 일관성 인식 스코어 校정 방법을 도입하여, 이를 대규모 ResNet 및 RepVGG 백본, 데이터 증강, 스코어 융합과 결합함으로써 최소 DCF 0.0855 및 EER 1.5880%를 달성하였다.
This report describes the UNISOUND submission for Track1 and Track2 of VoxCeleb Speaker Recognition Challenge 2023 (VoxSRC 2023). We submit the same system on Track 1 and Track 2, which is trained with only VoxCeleb2-dev. Large-scale ResNet and RepVGG architectures are developed for the challenge. We propose a consistency-aware score calibration method, which leverages the stability of audio voiceprints in similarity score by a Consistency Measure Factor (CMF). CMF brings a huge performance boost in this challenge. Our final system is a fusion of six models and achieves the first place in Track 1 and second place in Track 2 of VoxSRC 2023. The minDCF of our submission is 0.0855 and the EER is 1.5880%.
연구 동기 및 목표
- VoxCeleb2-dev 데이터만을 사용하여 VoxSRC 2023 도전 대회에 대응할 수 있는 고성능 음성인식 시스템을 개발하기 위해.
- 고도로 발전된 모델 아키텍처와 데이터 증강을 통해 시스템의 강인성과 정확도를 향상시키기 위해.
- 유사도 스코어 신뢰도를 향상시키는 데 기여하는 새로운 일관성 인식 스코어 校정 방법을 제안하기 위해.
- 폐쇄세트 및 개방세트 평가 프로토콜 양쪽에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- VoxCeleb2-dev 데이터만을 사용하여 최대 518층의 대규모 ResNet 및 RepVGG-B1 백본을 훈련하였으며, 3중 속도 증강 및 RIR/MUSAN 기반 데이터 증강을 적용하였다.
- 음성 씹기에서 80차원의 로그 멜 필터뱅크 특징을 추출하였으며, 음성 활동 검출 없이 평균 정규화를 수행하였다.
- 4개의 쿼리와 16개의 헤드를 사용한 다중쿼리 다중헤드 어텐션(MQMHA) 풀링을 적용하였으며, ResNet 기반 모델에는 표준편차만, RepVGG 기반 모델에는 평균과 표준편차를 모두 사용하였다.
- 두 단계 훈련 과정에서 마진 스케줄링과 학습률 감소를 적용한 AM-Softmax 및 AAM-Softmax 손실 함수를 적용하였다.
- 제안된 일관성 측정 요소(CMF)를 스코어 校정 방법으로 도입: CMF = (1/N) * ||Σ(x_i / ||x_i||)||로, 시간적 씹기 간 임베딩의 일관성 정도를 측정한다.
- 추가로 AS-Norm 및 QMF(Quality-aware Model Fusion)를 적용하여 다수의 모델에서 유도된 스코어를 더욱 정교하게 校정하고 융합하였다.
실험 결과
연구 질문
- RQ1외부 데이터 없이 VoxCeleb2-dev 데이터만으로 훈련된 단일 시스템이 VoxSRC 2023 도전 대회에서 최상위 성능을 달성할 수 있는가?
- RQ2임베딩의 안정성 정도를 시간적 씹기 간 측정하는 일관성 측정 요소(CMF)는 음성인식 성능 향상에 어떻게 기여하는가?
- RQ3ResNet 기반 모델의 풀링 레이어에서 표준편차만 사용하는 것과 평균과 표준편차를 모두 사용하는 것의 성능에 미치는 영향은 무엇인가?
- RQ4CMF, AS-Norm, QMF의 조합이 폐쇄세트 및 개방세트 평가 세트 양쪽에서 시스템 성능 향상에 얼마나 효과적인가?
- RQ5VoxSRC 2023에서 최소한의 데이터로도 ResNet518 및 RepVGG-B1와 같은 대규모 깊은 네트워크가 더 작은 모델보다 성능에서 뛰어나게 작용할 수 있는가?
주요 결과
- 최종 시스템은 여섯 개의 모델(ResNet314, ResNet518, RepVGG-B1)을 융합하여 VoxSRC2023 테스트 세트에서 최소 DCF 0.0855, EER 1.5880%의 성능을 달성하였다.
- CMF 기반의 스코어 校정 방법은 백엔드 기반 기준 대비 최소 DCF를 6.6% 감소시켜 개발 세트에서 성능 향상에 뚜렷한 기여를 하였다.
- 2초 길이의 오디오 씹기에서 CMF를 적용한 결과, 세그먼트 스코어링 방식보다 최소 DCF가 0.1190에서 0.1080으로 감소하여 성능 향상을 보였다.
- 2초 길이의 짧은 오디오에 대해 CMF 방법은 세그먼트 스코어링 대비 EER에서 1.3% 향상되고 최소 DCF에서 1.1% 향상되었다.
- CMF, AS-Norm, QMF를 융합한 모델은 VoxSRC2023 테스트 세트에서 EER 1.760% 및 최소 DCF 0.0993을 달성하여 모든 기준 모델을 초월하는 성능을 보였다.
- 이 시스템은 VoxSRC 2023에서 트랙 1에서 1위, 트랙 2에서 2위를 기록하였으며, 이전 연구 대비 VoxCeleb1-E와 VoxCeleb1-H에서 최소 DCF가 각각 12.1% 및 6.8% 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.