Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Speaker Embedding with Momentum Contrast

Ke Ding, Xuanji He|arXiv (Cornell University)|2020. 01. 07.
Speech Recognition and Synthesis참고 문헌 18인용 수 8
한 줄 요약

이 논문은 음성 인식에서 비지도 및 자기지도 학습을 위한 화자 임베딩 학습에 모멘텀 대비(Momentum Contrast, MoCo)를 제안한다. SpecAugment 기반 데이터 증강을 적용함으로써, 이 방법은 표준 크로스 엔트로피 사전학습보다 우수한 판별성 화자 표현을 학습하며, 하류 작업에 피지테이닝할 경우 상대 EER 향상률이 13.7%에 이를 수 있다.

ABSTRACT

Speaker verification can be formulated as a representation learning task, where speaker-discriminative embeddings are extracted from utterances of variable lengths. Momentum Contrast (MoCo) is a recently proposed unsupervised representation learning framework, and has shown its effectiveness for learning good feature representation for downstream vision tasks. In this work, we apply MoCo to learn speaker embedding from speech segments. We explore MoCo for both unsupervised learning and pretraining settings. In the unsupervised scenario, embedding is learned by MoCo from audio data without using any speaker specific information. On a large scale dataset with $2,500$ speakers, MoCo can achieve EER $4.275\%$ trained unsupervisedly, and the EER can decrease further to $3.58\%$ if extra unlabelled data are used. In the pretraining scenario, encoder trained by MoCo is used to initialize the downstream supervised training. With finetuning on the MoCo trained model, the equal error rate (EER) reduces $13.7\%$ relative ($1.44\%$ to $1.242\%$) compared to a carefully tuned baseline training from scratch. Comparative study confirms the effectiveness of MoCo learning good speaker embedding.

연구 동기 및 목표

  • 모멘텀 대비(MoCo)가 화자 레이블 없이도 효과적으로 화자 구별 임베딩을 학습할 수 있는지 조사하는 것.
  • 하류의 감독형 화자 인식 시스템을 위한 사전학습 방법으로 MoCo를 평가하는 것.
  • 하류 성능 측면에서 기존의 크로스 엔트로피 사전학습과 MoCo 사전학습을 비교하는 것.
  • 추가적인 비라벨 데이터가 MoCo의 표현 학습 능력에 미치는 영향을 평가하는 것.

제안 방법

  • 동일한 발화를 기반으로 한 양성 쌍을 생성하기 위해, 모멘텀 업데이트된 키를 갖는 듀얼 브랜치 인코더를 사용하여 음성에 대해 MoCo를 적응시키는 것.
  • 같은 음성 세그먼트에서 양성 쌍을 생성하기 위해 SpecAugment 기반 데이터 증강을 적용하여 대비 학습을 가능하게 하는 것.
  • 학습 안정성 향상과 표현 품질 향상을 위해 음성 키의 동적 큐를 유지하는 것.
  • 앵커와 키 표현 간의 내적 곱 유사도(코사인 유사도)를 기반으로 한 대비 손실을 사용하는 것.
  • 감독형 하류 학습을 위해 AAM(Additive Angular Margin) 손실을 사용하여 MoCo로 학습된 인코더를 피지테이닝하는 것.
  • 내부 및 VoxCeleb 데이터셋을 모두 활용하여 다양한 설정에서 비지도 및 사전학습 성능을 평가하는 것.

실험 결과

연구 질문

  • RQ1MoCo는 화자 신원 감시 없이도 비지도 방식으로 효과적인 화자 임베딩을 학습할 수 있는가?
  • RQ2표준 크로스 엔트로피 사전학습과 비교해 MoCo 사전학습이 하류 화자 인식 성능을 향상시키는가?
  • RQ3추가적인 비라벨 데이터의 포함이 MoCo의 화자 임베딩 학습 성능에 어떤 영향을 미치는가?
  • RQ4MoCo로 학습된 표현은 AAM과 같은 현대적인 판별 손실 함수와 호환되는가?
  • RQ5EER 및 minDCF 지표 측면에서 MoCo는 전통적인 i-vector 및 x-vector 기반 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • 비지도 설정에서, MoCo는 2,500명의 화자 데이터셋에서 EER 4.275%를 달성하였으며, 추가 비라벨 데이터를 활용할 경우 EER 3.58%로 향상되었다.
  • 사전학습 방법으로 사용할 경우, MoCo는 AAM 손실을 사용해 피지테이닝할 때 동일한 데이터셋에서 EER를 1.44%에서 1.242%로 낮추어 상대적 향상률 13.7%를 달성하였다.
  • 크로스 엔트로피 사전학습은 하류 AAM 학습에 도움이 되지 않으며, 오히려 성능 저하를 초래할 수 있으나, MoCo 사전학습은 그렇지 않다.
  • VoxCeleb1 데이터셋에서 MoCo 사전학습은 코사인 백엔드를 사용할 경우 EER를 2.402%로 낮추어 CE 사전학습 및 표준 AAM 모델을 모두 능가하였다.
  • MoCo로 학습된 표현은 다양한 평가 프로토콜과 백엔드에서 잘 일반화되어 일관된 성능 향상을 보였다.
  • MoCo 사전학습의 성능 향상은 minDCF 0.01 및 minDCF 0.001와 같은 다양한 지표에서도 일관되게 나타나, 다양한 가짜 경고 및 가짜 거부의 상호보완 전략에 대한 강건성을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.