Skip to main content
QUICK REVIEW

[논문 리뷰] Joint gender and age estimation based on speech signals using x-vectors and transfer learning

Damian Kwaśny, Daria Hemmerling|arXiv (Cornell University)|2020. 12. 02.
Speech Recognition and Synthesis참고 문헌 17인용 수 9
한 줄 요약

이 논문은 x-벡터와 전이 학습을 사용하여 병렬로 성별과 연령을 추정하는 시스템을 제안하며, 표준 TDNN 대신 더 깊은 QuartzNet 아키텍처를 사용한다. VoxCeleb 및 Common Voice 데이터셋에서의 사전 훈련이 성능을 크게 향상시키며, TIMIT에서 평균 절대 오차(MAE) 5.12년(남성) 및 5.29년(여성)의 최신 기술 성과를 달성하고 성별 분류 정확도는 99.6%에 이른다.

ABSTRACT

In this paper we extend the x-vector framework for the task of speaker's age estimation and gender classification. In particular, we replace the baseline multilayer-TDNN architecture with QuartzNet, a convolutional architecture that has gained success in the field of speech recognition. We further propose a two-staged transfer learning scheme, utilizing large scale speech datasets: VoxCeleb and Common Voice, and usage of multitask learning to allow for joint age estimation and gender classification with a single system. We train and evaluate the performance on the TIMIT dataset. The proposed transfer learning scheme yields consecutive performance improvements in terms of both age estimation error and gender classification accuracy and the best performing system achieves new state-of-the-art results on the task of age estimation on the TIMIT TEST dataset with MAE of 5.12 and 5.29 years and RMSE of 7.24 and 8.12 years for male and female speakers respectively while maintaining a gender classification accuracy of 99.6%.

연구 동기 및 목표

  • 음성 신호를 기반으로 한 병합된 화자 연령 추정 및 성별 분류의 정확도를 딥 러닝을 통해 향상시키기 위해.
  • 더 나은 특징 표현을 위해 표준 TDNN 기반 x-벡터 아키텍처를 더 깊은 QuartzNet 아키텍처로 대체하기 위해.
  • 대규모 음성 데이터셋(VoxCeleb 및 Common Voice)을 활용한 전이 학습의 효과를 저자원 환경에서의 연령 및 성별 추정에 대해 조사하기 위해.
  • 연령 추정 및 성별 분류 모두에서 TIMIT 데이터셋에서 최신 기술 성과를 달성하기 위해.
  • 다중 작업 학습을 통한 병합 회귀 및 분류가 모델 일반화 능력과 성능 향상에 기여함을 보여주기 위해.

제안 방법

  • 시스템은 전통적인 TDNN 아키텍처를 대체하기 위해 QuartzNet 기반 신경망을 x-벡터 임bedder로 사용한다.
  • 임bedder는 컨볼루션 블록, 잔차 연결 및 통계 풀링(평균 및 표준편차)을 사용하여 길이가 변하는 음성 발화에서 고정 크기의 임베딩을 추출한다.
  • 이중 전이 학습 방식을 적용한다: 먼저 VoxCeleb에서 화자 인식을 위한 사전 훈련을 수행하고, 그 후 TIMIT에서 연령 회귀 및 성별 분류를 병행하는 방식으로 미세조정한다.
  • 추가로 Common Voice에서의 사전 훈련을 통해 성능 향상이 이루어지며, 특히 MFCC 기반 특징에서 두드러진다.
  • 프론트엔드 헤드는 두 개의 완전 연결 브랜치로 구성되며, 하나는 연령 회귀를 위해, 다른 하나는 성별 분류를 위해 설계되었고, 다중 작업 학습을 통해 함께 훈련된다.
  • 모델은 TIMIT 데이터셋을 사용하여 NVIDIA NeMo 프레임워크에서 훈련 및 평가되며, 표준 훈련-테스트 분할을 따른다.

실험 결과

연구 질문

  • RQ1더 깊은 QuartzNet 기반 x-벡터 아키텍처가 병합된 연령 및 성별 추정에서 표준 TDNN 기반 x-벡터보다 우수한 성능을 낼 수 있는가?
  • RQ2VoxCeleb 및 Common Voice와 같은 대규모 음성 데이터셋에서의 전이 학습이 TIMIT에서 저자원 환경에서의 연령 및 성별 추정 성능 향상에 얼마나 효과적인가?
  • RQ3연령 회귀 및 성별 분류를 병행하는 다중 작업 학습이 단일 작업 접근 방식보다 성능 향상에 기여하는가?
  • RQ4다른 입력 특징(MFCC 대비 멜 스펙트로그램)이 병합 추정 시스템의 최종 성능에 미치는 영향은 어떠한가?
  • RQ5제안된 이중 전이 학습 방식이 TIMIT 데이터셋에서 연령 추정 및 성별 분류 모두에서 최신 기술 성과를 달성할 수 있는가?

주요 결과

  • 제안된 시스템은 TIMIT 테스트 세트에서 남성 화자에 대해 평균 절대 오차(MAE) 5.12년, 여성 화자에 대해 5.29년으로 새로운 최신 기술 성과를 달성하였다.
  • 근미제곱오차(RMSE)는 남성 화자 기준 7.24년, 여성 화자 기준 8.12년으로 감소하여 이전 연구에 비해 상당한 향상이 이루어졌다.
  • 성별 분류 정확도는 99.6%에 도달하여, 연령 및 성별 병행 훈련에도 불구하고 강력한 성능을 보였다.
  • VoxCeleb에서의 사전 훈련만으로도 베이스라인 성능을 초월하였으며, 추가로 Common Voice에서의 사전 훈련을 통해 성능 향상이 이루어졌다.
  • MFCC 기반 시스템에서 이중 사전 훈련(VoxCeleb + Common Voice)을 수행한 결과가 이전의 DNN 기반 및 특징 엔지니어링 기반 접근 방식을 모두 능가하는 최고의 성능을 기록하였다.
  • QuartzNet 기반 임bedder 아키텍처는 연령 추정 및 성별 분류 모두에서 표준 TDNN 기반 x-벡터보다 일관되게 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.