Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Attention based Text-Dependent Speaker Verification

Shi-Xiong Zhang, Zhuo Chen|arXiv (Cornell University)|2017. 01. 03.
Speech Recognition and Synthesis참고 문헌 15인용 수 7
한 줄 요약

이 논문은 말하는 내용이 일정한 말자리에서의 화자 확인을 위한 엔드 투 엔드 주의 기반 시스템을 제안한다. 이 시스템은 노이즈에 강건한 프레임 수준의 특징을 추출하기 위해 화자 구별 CNN을 사용하며, 이를 학습 가능한 주의 메커니즘을 통해 유효한 수준의 표현으로 통합한다. 전체 시스템은 각 타겟 화자에 대해 가장 유사한 위조 화자(impersonator)를 자동으로 선택하는 엔드 투 엔드 기준을 사용해 공동 최적화되며, Windows 10 "Hey Cortana" 작업에서 4.1%의 동등 오류률(EER)을 달성하여 i-vector/PLDA 기반 시스템보다 9% 상대 오차 감소를 기록한다.

ABSTRACT

A new type of End-to-End system for text-dependent speaker verification is presented in this paper. Previously, using the phonetically discriminative/speaker discriminative DNNs as feature extractors for speaker verification has shown promising results. The extracted frame-level (DNN bottleneck, posterior or d-vector) features are equally weighted and aggregated to compute an utterance-level speaker representation (d-vector or i-vector). In this work we use speaker discriminative CNNs to extract the noise-robust frame-level features. These features are smartly combined to form an utterance-level speaker vector through an attention mechanism. The proposed attention model takes the speaker discriminative information and the phonetic information to learn the weights. The whole system, including the CNN and attention model, is joint optimized using an end-to-end criterion. The training algorithm imitates exactly the evaluation process --- directly mapping a test utterance and a few target speaker utterances into a single verification score. The algorithm can automatically select the most similar impostor for each target speaker to train the network. We demonstrated the effectiveness of the proposed end-to-end system on Windows $10$ "Hey Cortana" speaker verification task.

연구 동기 및 목표

  • 중간 표현 없이 직접 음성 문장을 검증 점수로 매핑하는 엔드 투 엔드 화자 확인 시스템을 개발하는 것.
  • 화자 구별 CNN을 활용해 프레임 수준의 특징을 추출하여 말자리 기반 화자 확인의 강건성과 성능을 향상시키는 것.
  • 화자 및 발음 정보를 함께 고려하는 주의 메커니즘을 도입하여 일정한 가중치 평균 방식을 대체함으로써 유효한 수준의 표현 학습을 향상시키는 것.
  • 실제 평가 과정을 모방하기 위해 전체 시스템을 엔드 투 엔드 기준으로 공동 최적화하여, 각 타겟 화자에 대해 가장 도전적인 위조 화자 샘플을 자동으로 선택하는 것.

제안 방법

  • 세 채널의 CNN은 정적, 델타, 델타-델타 MFCC 특징을 처리하며, 비대칭적 컨텍스트 창(시간 t-25에서 t+5)을 사용하여 화자 구별 프레임 수준의 특징을 추출한다.
  • 주의 메커니즘은 화자 구별 정보와 발음 정보를 모두 활용하여 프레임 수준의 특징에 대해 동적 가중치를 학습하여 압축된 유효한 수준의 화자 벡터를 생성한다.
  • 주의 메커니즘은 컨텍스트 인식 가중치를 계산하는 스케일드 닷프로덕트 주의 모듈에 기반하며, 비음수 주의 점수를 보장하기 위해 소프트플러스 활성화 함수를 사용한다.
  • CNN과 주의 네트워크를 포함한 전체 시스템은 테스트 및 타겟 화자 음성 문장을 직접 검증 점수로 매핑하는 엔드 투 엔드 손실 함수를 통해 공동 최적화된다.
  • 학습 중에 알고리즘이 화자 벡터 풀을 활용하여 각 타겟 화자에 대해 가장 유사한 위조 화자 화자를 자동으로 선택하며, 실제 거부 시나리오를 시뮬레이션한다.
  • 학습은 N=6명의 화자당 등록 음성 문장과 T₁=1, T₂=5의 음성 샘플 비율(음성 대비 양성 샘플 비율)을 사용한 미니배치 전략을 사용하여 평가 조건을 재현한다.

실험 결과

연구 질문

  • RQ1특징 추출과 점수 매핑을 공동 최적화하는 엔드 투 엔드 시스템이 기존의 파이프라인 기반 접근 방식보다 말자리 기반 화자 확인에서 더 우수한 성능을 낼 수 있는가?
  • RQ2화자 및 발음 정보를 함께 고려하는 주의 메커니즘이 일정한 가중치 평균 방식에 비해 유효한 수준의 화자 표현 품질을 어떻게 향상시키는가?
  • RQ3엔드 투 엔드 학습 중에 가장 유사한 위조 화자 샘플을 자동으로 선택하기 위해 화자 벡터 풀을 사용할 경우 어떤 영향을 미치는가?
  • RQ4DNN이나 LSTMs에 비해 CNN 기반 특징 추출기가 말자리 기반 화자 확인에서 성능과 강건성 측면에서 어떻게 비교되는가?
  • RQ5전체 네트워크 아키텍처를 공동 최적화할 경우 실세계 키워드 트리거 기반 화자 확인 작업에서 검증 정확도는 어느 정도 향상되는가?

주요 결과

  • 제안된 엔드 투 엔드 시스템은 Windows 10 "Hey Cortana" 화자 확인 작업에서 4.1%의 동등 오류률(EER)을 달성하여 i-vector/PLDA 기반 시스템보다 9% 상대 오차 감소를 기록했다.
  • 학습 중에 가장 유사한 위조 화자를 선택하기 위해 화자 벡터 풀을 사용함으로써 EER가 랜덤 샘플링의 4.6%에서 4.1%로 감소하여 현실적인 음성 샘플링의 중요성을 입증했다.
  • 후행 확률에 기반한 주의 메커니즘 대비 학습 가능한 가중치를 사용한 주의 메커니즘이 최고의 성능을 보였으며, EER는 4.1%로 감소했고, 후행 확률 기반 주의 메커니즘은 4.5%였다.
  • 같은 수의 파라미터를 가진 DNN에 비해 CNN 기반 특징 추출기가 6% 상대 오차 감소를 기록하여 CNN이 화자 구별 표현 학습에 효과적임을 시사했다.
  • 엔드 투 엔드 시스템은 GMM-UBM 및 i-vector/PLDA 기반 시스템보다 각각 25%와 9% 상대 오차 감소를 기록하여 공동 최적화의 이점을 입증했다.
  • 실세계, 짧은 음성 문장, 키워드 트리거 기반 화자 확인 작업에서 최고 성능을 기록하여 실용적 적용 가능성의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.