Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Speaker Recognition Using Speech Enhancement And Attention Model

Yanpei Shi, Qiang Huang|arXiv (Cornell University)|2020. 01. 14.
Speech Recognition and Synthesis참고 문헌 32인용 수 8
한 줄 요약

이 논문은 다단계 주의 메커니즘을 사용하여 음성 강화와 화자 인식을 연쇄적으로 최적화하는 공동 최적화 프레임워크를 제안한다. 이는 잡음 환경에서의 강인성을 향상시키기 위한 것이다. 시간, 주파수, 채널 주의를 통합한 단일 엔드 투 엔드 학습 가능한 모델로 음성 강화와 화자 검증을 통합함으로써, 다양한 잡음 조건에서 VoxCeleb1에서 기존 강력한 기준 모델 대비 최상위 1위 및 최상위 5위 정확도가 최대 3% 향상된다.

ABSTRACT

In this paper, a novel architecture for speaker recognition is proposed by cascading speech enhancement and speaker processing. Its aim is to improve speaker recognition performance when speech signals are corrupted by noise. Instead of individually processing speech enhancement and speaker recognition, the two modules are integrated into one framework by a joint optimisation using deep neural networks. Furthermore, to increase robustness against noise, a multi-stage attention mechanism is employed to highlight the speaker related features learned from context information in time and frequency domain. To evaluate speaker identification and verification performance of the proposed approach, we test it on the dataset of VoxCeleb1, one of mostly used benchmark datasets. Moreover, the robustness of our proposed approach is also tested on VoxCeleb1 data when being corrupted by three types of interferences, general noise, music, and babble, at different signal-to-noise ratio (SNR) levels. The obtained results show that the proposed approach using speech enhancement and multi-stage attention models outperforms two strong baselines not using them in most acoustic conditions in our experiments.

연구 동기 및 목표

  • 잡음으로 인한 열악한 음성 환경에서의 화자 인식 강인성을 향상시키기 위해.
  • 음성 강화 및 화자 인식 모듈을 별도로 학습하는 데서 비롯하는 한계, 즉 최적의 특징 학습이 이루어지지 않을 수 있음을 해결하기 위해.
  • 음성 강화와 화자 인식을 단일 엔드 투 엔드 프레임워크로 통합하고 공동 최적화를 수행하기 위해.
  • 시간, 주파수, 채널 차원에서 화자 관련 정보를 강조하는 다단계 주의 메커니즘을 도입하여 특징 학습을 향상시키기 위해.
  • 실제 잡음 조건(배블, 음악, 일반 잡음)과 다양한 신호 대 잡음비(SNR) 수준에서 표준 벤치마크를 기반으로 제안된 방법을 평가하기 위해.

제안 방법

  • 모델은 음성 강화 네트워크(SE-Net)와 화자 식별 네트워크(SID-Net)를 순차적으로 연결한 캐스케이드 아키텍처를 사용하며, 단일 손실 함수를 통해 공동 최적화된다.
  • SE-Net은 다단계 주의(MS) 블록을 활용한 11개의 확장 컨볼루션 계층을 사용하여 스펙트로그램 입력에서 잡음을 억제한다.
  • 다단계 주의 메커니즘은 채널 주의, 주파수 주의, 시간 주의의 세 개의 순차적 블록으로 구성되며, 관련 특징을 강조하기 위해 계층적으로 적용된다.
  • SID-Net은 강화된 스펙트로그램에서 강인한 화자 임베딩을 추출하기 위해 8개의 잔차 컨볼루션 계층과 다단계 주의 블록을 사용한다.
  • 주의 모듈은 SE-Net과 SID-Net의 각 컨볼루션 계층 이후에 삽입되어 관련성에 따라 특징을 동적으로 가중한다.
  • 전체 모델은 기본 학습률 1e-3, 매 에포크 0.9의 감쇠율을 가진 Adam 옵timizer를 사용하여 학습된다.

실험 결과

연구 질문

  • RQ1음성 강화와 화자 인식을 공동 최적화하는 것이 별도 학습 대비 잡음 환경에서 성능 향상에 기여하는가?
  • RQ2다단계 주의 메커니즘의 통합이 다양한 유형의 잡음에서 화자 인식의 강인성을 어떻게 향상시키는가?
  • RQ3주의 모듈의 위치—음성 강화 또는 화자 인식 모듈 내부—가 성능에 상당한 영향을 미치는가?
  • RQ4제안된 방법은 다양한 신호 대 잡음비(SNR) 수준과 배블, 음악, 일반 잡음 등의 잡음 유형에서 어떻게 성능을 발휘하는가?
  • RQ5다른 모듈에 주의를 통합한 모델(예: SE-MS+SID 및 SE+SID-MS)을 조합하면 인식 정확도가 추가로 향상되는가?

주요 결과

  • 제안된 SE+SID-MS 모델은 모든 잡음 조건에서 기준 SID 모델 대비 최상위 1위 및 최상위 5위 정확도에서 2–3%의 절대적 향상을 달성했다.
  • SE-Net과 SID-Net 양쪽에 다단계 주의를 적용함으로써, 저SNR 수준(예: 0 dB)에서도 1–2%의 상대적 향상이 나타나, 잡음 강인성이 향상됨을 확인했다.
  • 화자 검증에서 SE-MS+SID 모델이 다른 구성보다 뛰어난 성능을 보였으며, 특히 저SNR의 배블 잡음 환경에서 강화 모듈 내 주의 메커니즘이 성능 향상에 기여했다.
  • SE-MS+SID와 SE+SID-MS 모델의 선형 조합은 향상된 결과를 얻었으며, 특히 배블 잡음에서 SE-MS+SID 구성 요소가 정확도 향상에 더 크게 기여했다.
  • 공동 최적화 프레임워크는 사전 학습된 화자 모델을 사용한 이전 방법들을 능가했으며, 엔드 투 엔드 학습의 이점을 입증했다.
  • 일반 잡음, 음악, 배블 등 모든 잡음 유형에서 일관된 성능 향상이 관찰되어, 다양한 음성 품질 열악한 환경에서도 강인함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.