Skip to main content
QUICK REVIEW

[논문 리뷰] Target Speaker Extraction for Overlapped Multi-Talker Speaker Verification

Wei Rao, Chenglin Xu|arXiv (Cornell University)|2019. 02. 07.
Speech Recognition and Synthesis참고 문헌 15인용 수 4
한 줄 요약

이 논문은 겹치는 다중 화자 발화에서 목표 화자 추출 프레임워크를 제안하며, i-vector/PLDA 화자 확인 시스템에 입력하기 전에 혼합 발화에서 목표 화자의 음성만 분리하는 목표 화자 추출 모듈을 사용한다. 이 방법은 상대적 EER을 65.7% 감소시켰으며, SBF-MTSAL-Concat이 SBF-MTSAL보다 우수한 성능을 보였다.

ABSTRACT

The performance of speaker verification degrades significantly when the test speech is corrupted by interference speakers. Speaker diarization does well to separate speakers if the speakers are temporally overlapped. However, if multi-talkers speak at the same time, we need the technique to separate the speech in the spectral domain. This paper proposes an overlapped multi-talker speaker verification framework by using target speaker extraction methods. Specifically, given the target speaker information, the target speaker's speech is firstly extracted from the overlapped multi-talker speech by a target speaker extraction module. Then, the extracted speech is passed to the speaker verification system. Experimental results show that the proposed approach significantly improves the performance of overlapped multi-talker speaker verification and achieves 65.7% relative EER reduction.

연구 동기 및 목표

  • 여러 화자가 동시에 말할 경우 발생하는 화자 확인 성능 저하 문제를 해결하기 위해.
  • 기존 음성 분離 방법이 화자 수를 사전에 알고 있어야 하는 한계를 극복하기 위해.
  • 목표 화자 추출을 통해 완전히 겹치는 다중 화자 상황에서의 화자 확인 강인성을 향상시키기 위해.
  • 겹치는 다중 화자 환경에서 두 가지 목표 화자 추출 네트워크—SBF-MTSAL과 SBF-MTSAL-Concat—의 효과성을 비교하기 위해.
  • 청결한 음성과 추출된 음성 간의 불일치를 줄이기 위해 청결한 음성과 추출된 음성을 결합한 훈련 데이터를 사용하기 위해.

제안 방법

  • 프레임워크는 등록 발화를 보조 정보로 활용하여 혼합 발화에서 목표 화자의 음성을 분리하는 목표 화자 추출 모듈을 사용한다.
  • 목표 화자 추출 네트워크는 위상 민감한 마스크를 추정하기 위해 크기 및 시간 스펙트럼 근사 손실을 활용하여 음성 재구성 성능을 향상시킨다.
  • SBF-MTSAL은 CADNN 기반 아키텍처에서 마스크 추정을 정교화하기 위해 보조 네트워크를 통해 적응 가중치를 생성한다.
  • SBF-MTSAL-Concat는 마스크 추정 이전에 보조 특징과 혼합 특징을 연결함으로써 표현 학습 성능을 향상시켜 SBF-MTSAL을 개선한다.
  • 추출된 음성은 표준 i-vector/PLDA 화자 확인 시스템을 통해 처리되어 확인된다.
  • 청결한 음성과 추출된 음성을 결합한 훈련 세트(클린+추출)는 개발 데이터에서 추출된 음성을 통합하여 만들며, 추출된 음성과 청결한 음성 간의 불일치를 줄인다.

실험 결과

연구 질문

  • RQ1목표 화자 추출이 완전히 겹치는 다중 화자 상황에서 화자 확인 성능을 크게 향상시킬 수 있는가?
  • RQ2SBF-MTSAL과 SBF-MTSAL-Concat의 성능은 겹치는 다중 화자 화자 확인 환경에서 어떻게 비교되는가?
  • RQ3청결한 음성과 추출된 음성을 훈련 단계에서 결합함으로써 추출된 음성과 청결한 음성 간의 불일치는 어느 정도 감소하는가?
  • RQ4시험 음성이 여러 화자에 의해 완전히 겹쳐질 경우, 제안된 프레임워크는 강인성을 유지하는가?
  • RQ5이 설정에서 목표 화자 추출의 상한 성능는 얼마이며, 제안된 방법은 그에 얼마나 가까운가?

주요 결과

  • 제안된 목표 화자 추출 프레임워크는 완전히 겹치는 테스트 데이터에서 기준 시스템 대비 65.7%의 상대적 EER 감소를 달성했다.
  • SBF-MTSAL-Concat는 SBF-MTSAL보다 우수한 EER 및 DCF 성능을 보이며, 겹치는 다중 화자 화자 확인에서 더 나은 성능을 보였다.
  • 청결한 음성과 추출된 음성을 결합한 훈련 세트를 사용할 경우 SBF-MTSAL-Concat에서 혼합 테스트 세트 성능 향상이 관찰되어, 효과적인 불일치 보정이 이루어졌음을 시사한다.
  • 청결한 음성과 추출된 음성을 결합한 훈련 세트는 청결한 테스트 세트에서 EER을 향상시켰지만 DCF 성능을 떨어뜨렸으며, 일반화 성능에 상충되는 요소가 있음을 시사한다.
  • 기준 시스템은 완전히 겹치는 테스트 데이터에서 심각한 성능 저하를 보였으며, 이는 다중 화자 간섭 문제의 도전성을 강조한다.
  • 상한 성능(이deal 추출)은 제안된 방법이 최적에 매우 가까운 성능을 보이며, 실세계 적용 가능성의 강력한 잠재력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.