Skip to main content
QUICK REVIEW

[논문 리뷰] DeepVOX: Discovering Features from Raw Audio for Speaker Recognition in Degraded Audio Signals.

Anurag Chowdhury, Arun Ross|arXiv (Cornell University)|2020. 08. 26.
Speech and Audio Processing참고 문헌 52인용 수 5
한 줄 요약

이 논문은 원시 음성 오디오에서 직접 시간 도메인 필터뱅크를 학습하여 음성 품질 저하에 강건한 특징을 추출하는 1D 컨volutional 신경망인 DeepVOX를 제안한다. 적응형 트리플릿 마이닝과 엔드 투 엔드 학습을 통해 DeepVOX는 발성원천과 부정맥 특징을 모두 포착하며, 다양한 데이터셋과 오디오 품질 저하 유형에서 기존의 수작업 필터뱅크와 xVector-PLDA, iVector-PLDA와 같은 기존의 발화자 인식 시스템을 능가한다.

ABSTRACT

Automatic speaker recognition algorithms typically use pre-defined filterbanks, such as Mel-Frequency and Gammatone filterbanks, for characterizing speech audio. The design of these filterbanks is based on domain-knowledge and limited empirical observations. The resultant features, therefore, may not generalize well to different types of audio degradation. In this work, we propose a deep learning-based technique to induce the filterbank design from vast amounts of speech audio. The purpose of such a filterbank is to extract features robust to degradations in the input audio. To this effect, a 1D convolutional neural network is designed to learn a time-domain filterbank called DeepVOX directly from raw speech audio. Secondly, an adaptive triplet mining technique is developed to efficiently mine the data samples best suited to train the filterbank. Thirdly, a detailed ablation study of the DeepVOX filterbanks reveals the presence of both vocal source and vocal tract characteristics in the extracted features. Experimental results on VOXCeleb2, NIST SRE 2008 and 2010, and Fisher speech datasets demonstrate the efficacy of the DeepVOX features across a variety of audio degradations, multi-lingual speech data, and varying-duration speech audio. The DeepVOX features also improve the performance of existing speaker recognition algorithms, such as the xVector-PLDA and the iVector-PLDA.

연구 동기 및 목표

  • 다양한 오디오 품질 저하 조건에서 수작업으로 설계된 필터뱅크(예: 멜 주파수, 감마톤)보다 더 잘 일반화하는 데이터 기반 필터뱅크를 개발하는 것.
  • 분야 특화 가정에 의존하지 않고 원시 음성 오디오에서 직접 시간 도메인 필터뱅크를 학습하는 것.
  • 엔드 투 엔드 특징 학습을 통해 저품질 또는 노이즈가 많은 오디오 환경에서의 발화자 인식 성능을 향상시키는 것.
  • 학습된 DeepVOX 특징을 xVector-PLDA 및 iVector-PLDA와 같은 기존의 발화자 인식 시스템에 통합하여 성능 향상을 이루는 것.

제안 방법

  • 원시 음성 오디오에서 엔드 투 엔드로 학습되는 1D 컨volutional 신경망이 시간 도메인 필터뱅크인 DeepVOX를 학습한다.
  • 특징의 분류 능력을 극대화하기 위해 하드 트레이닝 샘플을 효율적으로 선택하기 위해 적응형 트리플릿 마이닝 기법을 사용한다.
  • 내부 발화자 특징의 응집성과 외부 발화자 간의 분리성을 장려하기 위해 대비 손실 기반 목표 함수를 사용하여 필터뱅크를 학습한다.
  • 해당 분석을 통해 학습된 필터뱅크는 발성원천과 부정맥 특징을 모두 포착하고 있음을 확인할 수 있다.
  • 다양한 오디오 품질 저하 조건에서 VOXCeleb2, NIST SRE 2008 및 2010, Fisher 등의 여러 데이터셋에서 성능을 평가한다.
  • 학습된 DeepVOX 특징을 표준 발화자 인식 파이프라인에 통합하여 성능 향상 여부를 평가한다.

실험 결과

연구 질문

  • RQ1원시 오디오에서 직접 학습된 딥러닝 기반 필터뱅크가 오디오 품질 저하 조건에서 기존의 수작업 필터뱅크보다 우수한 성능을 보일 수 있는가?
  • RQ2학습된 필터뱅크 특징에 어떤 종류의 발화자 특징(예: 발성원천, 부정맥)이 포함되어 있는가?
  • RQ3적응형 트리플릿 마이닝 전략이 학습된 필터뱅크의 강건성과 일반화 능력을 어떻게 향상시키는가?
  • RQ4DeepVOX 특징이 xVector-PLDA 및 iVector-PLDA와 같은 기존의 발화자 인식 시스템에서 얼마나 성능 향상을 이룬다기 있는가?
  • RQ5이 방법은 다국어 데이터와 다양한 음성 지속 시간에 어떻게 일반화되는가?

주요 결과

  • DeepVOX 특징은 VOXCeleb2, NIST SRE 2008 및 2010, Fisher 데이터셋에서 다양한 오디오 품질 저하 조건에서도 뛰어난 성능을 기록한다.
  • 추론 분석 결과, DeepVOX 특징이 발성원천과 부정맥 특징을 모두 포함하고 있음을 확인할 수 있다.
  • 적응형 트리플릿 마이닝 기법은 원시 오디오에서 분류 가능한 특징을 효과적으로 학습할 수 있는 능력을 크게 향상시킨다.
  • DeepVOX 특징은 xVector-PLDA 및 iVector-PLDA 시스템의 성능을 향상시켜, 호환성과 성능 향상 잠재력을 입증한다.
  • 이 방법은 다국어 음성 데이터와 다양한 음성 지속 시간에 대해 잘 일반화되며, 입력 변동성에 대한 강건성을 보여준다.
  • 품질 저하 조건 하에서 멜 주파수 및 감마톤 필터뱅크보다 발화자 인식 정확도 측면에서 학습된 필터뱅크가 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.