Skip to main content
QUICK REVIEW

[논문 리뷰] The SJTU X-LANCE Lab System for CNSRC 2022

Zhengyang Chen, Bei Liu|arXiv (Cornell University)|2022. 06. 23.
Speech Recognition and Synthesis인용 수 11
한 줄 요약

이 논문은 CNSRC 2022 음성 인식 및 검색 도전 대회를 위한 SJTU X-LANCE Lab의 시스템을 제시하며, ResNet 아키텍처 기반의 더 깊은 잔차 네트워크 변형(Deeper r-vector)을 도입한다. 이 시스템은 외부 데이터 없이도 데이터 증강, 적응형 점수 정규화, 앙상블 융합을 통해 음성 인식에서 0.2975의 minDCF, 음성 검색에서 0.4626의 mAP를 기록하며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

This technical report describes the SJTU X-LANCE Lab system for the three tracks in CNSRC 2022. In this challenge, we explored the speaker embedding modeling ability of deep ResNet (Deeper r-vector). All the systems are only trained on the Cnceleb training set and we use the same systems for the three tracks in CNSRC 2022. In this challenge, our system ranks the first place in the fixed track of speaker verification task. Our best single system and fusion system achieve 0.3164 and 0.2975 minDCF respectively. Besides, we submit the result of ResNet221 to the speaker retrieval track and achieve 0.4626 mAP. More importantly, we have helped the wespeaker [1] toolkit reproduce our result: https://github.com/wenet-e2e/wespeaker.

연구 동기 및 목표

  • CN-Celeb 학습 세트만을 사용하여 CNSRC 2022 도전 대회를 위한 강력한 음성 임bedding 시스템을 개발하기 위해.
  • 더 깊은 r-vector 아키텍처의 깊이를 늘여 음성 인식 및 검색 성능 향상에 기여하는지 조사하기 위해.
  • 노이즈, 리버버브, 속도 변형과 같은 데이터 증강 기법이 모델 일반화에 미치는 영향을 평가하기 위해.
  • 임베딩 평균화 및 적응형 점수 정규화와 같은 스코링 전략을 최적화하여 minDCF와 EER을 향상시키기 위해.
  • 통일된 시스템 아키텍처를 사용하여 CNSRC 2022의 세 가지 트랙에서 모두 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 80차원의 fbank 특징과 통계 풀링을 사용하여 고정 길이 임베딩을 생성하는 34층의 r-vector 백본을 활용한다.
  • 1x1, 3x3, 1x1 컨볼루션과 스트라이드 조정을 통해 깊이를 증가시킨 잔차 블록을 확장하여, 최대 221층과 293층에 이르는 깊이를 가진 더 깊은 잔차 네트워크 변형인 Deeper r-vector를 도입한다.
  • 각 샘플당 60% 확률로 온라인에서 데이터 증강을 적용하며, 추가 노이즈(MUSAN), 리버버브(RIR 데이터셋), 속도 변형(0.9x 및 1.1x)을 포함한다.
  • 학습 파이프라인은 두 단계로 구성된다: 첫 번째 단계는 속도 변형 데이터와 마진 0.2로 AAM 손실 학습을 수행하고, 두 번째 단계는 마진 0.5와 6초 세그먼트를 사용한 대규모 마진 미세조정을 수행한다.
  • 코사인 유사도를 사용하며, 적응형 점수 정규화와 함께 다중 등록 음성 문장 처리를 위한 세 가지 전략(Utt-Concat, Emb-Avg, Score-Avg)을 적용한다. 최종 결과에는 Emb-Avg와 ASnorm를 선택한다.
  • 융합을 위해 대규모 마진 미세조정을 거친 여러 시스템(예: ResNet221, ResNet293 등)을 결합하여 일반화 능력을 향상시키고 minDCF를 감소시킨다.

실험 결과

연구 질문

  • RQ1r-vector 아키텍처의 깊이를 늘일 경우 CN-Celeb 데이터셋에서 음성 인식 및 검색 성능에 어떤 영향을 미치는가?
  • RQ2온라인 데이터 증강(노이즈, 리버버브, 속도 변형)이 모델의 강건성과 일반화 능력에 어떤 영향을 미치는가?
  • RQ3다중 등록 음성 문장이 있는 음성 인식에서, Utt-Concat, Emb-Avg, Score-Avg 중 어떤 스코링 전략이 가장 높은 성능을 낼 수 있는가?
  • RQ4적응형 점수 정규화와 대규모 마진 미세조정은 표준 학습을 초월하여 minDCF와 EER을 얼마나 향상시킬 수 있는가?
  • RQ5모델 앙상블 융합은 여러 개의 깊은 ResNet 변종에서 minDCF 감소에 얼마나 효과적인가?

주요 결과

  • 221층의 Deeper r-vector 시스템은 음성 인식에서 최고의 단일 시스템 성능을 기록하여 minDCF 0.3164와 EER 5.227%를 달성하였다.
  • 대규모 마진 미세조정을 거친 여러 시스템의 앙상블 융합은 최저 minDCF 0.2975를 기록하여 모든 개별 시스템을 초월하였다.
  • Emb-Avg 스코링 전략과 적응형 점수 정규화의 조합은 첫 번째 단계에서 minDCF를 0.3707로 감소시키고, 최종 시스템에서는 0.3164까지 낮추었다.
  • ResNet221+LM 시스템은 음성 검색 트랙에서 0.4626 mAP를 기록하여 강력한 검색 능력을 입증하였다.
  • 초기 AAM 학습 이후 대규모 마진 미세조정을 적용함으로써 모든 모델에서 minDCF와 EER이 크게 향상되었으며, ResNet293+LM는 최저 EER 5.227%를 기록하였다.
  • 외부 데이터 없이도 CN-Celeb 학습 세트와 효과적인 데이터 증강에 의존함으로써 시스템은 강력한 성능을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.