[논문 리뷰] Speech-based Age and Gender Prediction with Transformers
이 논문은 정제된 데이터셋에서 미세조정된 wav2vec 2.0 트랜스포머를 사용하여 음성 기반 연령 및 성별 예측 시스템을 제안하며, 연령 예측의 MAE는 7.1~10.8이며 성별 예측 정확도는 ≥91.1%를 달성한다. 기존 수작업 특징 기반 모델 대비 연령 예측에서 9% UAR 향상, 성별 예측에서 4% 향상되었으며, 재현 가능성을 위해 최고 성능 모델과 데이터 분할을 공개한다.
We report on the curation of several publicly available datasets for age and gender prediction. Furthermore, we present experiments to predict age and gender with models based on a pre-trained wav2vec 2.0. Depending on the dataset, we achieve an MAE between 7.1 years and 10.8 years for age, and at least 91.1% ACC for gender (female, male, child). Compared to a modelling approach built on handcrafted features, our proposed system shows an improvement of 9% UAR for age and 4% UAR for gender. To make our findings reproducible, we release the best performing model to the community as well as the sample lists of the data splits.
연구 동기 및 목표
- 연령 및 성별 예측을 위한 표준화되고 공개된 데이터셋의 부족을 해결하고자, 정제된 훈련/검증/테스트 분할을 정제하고 공개한다.
- 기존 수작업 특징 기반 접근 방식에 비해 자기지도 학습된 트랜스포머 모델(wav2vec 2.0)을 활용하여 음성 기반 연령 및 성별 예측 성능을 향상시키고자 한다.
- 모델의 일반화 능력을 도메인(내부 코퍼스 대 비내부 코퍼스), 모델 아키텍처(다중 헤드 대 단일 헤드), 그리고 깊이(트랜스포머 레이어 수) 측면에서 조사하고자 한다.
- 향후 음성 기반 연령 및 성별 추정 연구를 위한 재현 가능하고 오픈소스 기반 모델 및 데이터 분할을 제공하고자 한다.
제안 방법
- aGender, CommonVoice, VoxCeleb2, Timit의 네 개 공개 데이터셋을 정제하고 연령 및 성별 레이블을 표준화한 후, 사전 학습된 wav2vec 2.0 모델을 이들 데이터셋에 대해 미세조정한다.
- 공유된 인코더와 연령(회귀)과 성별(분류)을 위한 별도의 헤드를 갖춘 다중 작업 학습 설정을 사용하여 동시 예측을 가능하게 한다.
- 단일 헤드 및 다중 헤드 아키텍처를 평가하여 내부 코퍼스 및 비내부 코퍼스 설정 간 성능을 비교한다.
- 트랜스포머 레이어 수를 1에서 24까지 체계적으로 변화시켜 정확도와 추론 속도 사이의 최적의 균형을 도출한다.
- 2010년 파링구이스틱 챌린지 기준선과의 비교를 위해 연령 레이블을 이산 클래스(어린이, 청소년, 성인, 고령자)로 매핑한다.
- 재현 가능성을 확보하기 위해 최고 성능 모델과 데이터 분할을 GitHub 레포지토리에 공개한다.

실험 결과
연구 질문
- RQ1미세조정된 wav2vec 2.0 트랜스포머 모델은 기존 수작업 특징 기반 시스템에 비해 연령 및 성별 예측에서 어떻게 성능을 냈는가?
- RQ2정확도와 추론 효율성의 균형을 고려할 때, 연령 및 성별 예측에 최적의 트랜스포머 레이어 수는 얼마인가?
- RQ3다양한 데이터셋에서 내부 코퍼스 대비 비내부 코퍼스 설정 간 모델 성능은 어떻게 변화하는가?
- RQ4감정 어조가 강한 음성은 중립 음성 데이터로 학습된 모델의 성능을 얼마나 떨어뜨리는가?
- RQ5독립적인 모델보다 통합된 모델이 연령과 성별을 동시에 예측하는 데 더 효과적인가, 그리고 이는 작업별 최적화 기반 기준선과 비교해 어떻게 되는가?
주요 결과
- 제안된 wav2vec 2.0 기반 모델은 다양한 데이터셋에서 연령 예측의 평균 절대 오차(MAE)가 7.1~10.8년으로 나타나, 2010년 파링구이스틱 챌린지 기준선보다 뚜렷이 뛰어나다.
- 성별 분류(Female, Male, Child)의 경우 최소 91.1%의 정확도를 달성했으며, 베를린 감정 데이터베이스의 중립 음성 샘플에서 96.04%의 UAR을 기록했다.
- 수작업 특징 기반 기준선 대비 연령 예측에서 9% 포인트, 성별 예측에서 4% 포인트의 UAR 향상을 달성했다.
- 6개의 트랜스포머 레이어를 사용할 경우 성능과 추론 속도 사이의 최적 균형을 확보했으며, 파라미터 수를 3.5배 줄이고 추론 시간을 3배 감소시켰다.
- 감정 어조가 강한 음성에서는 성능이 저하되었으며, MAE가 중립 샘플의 5.94에서 8.35로 상승하여 감정적 억양에 민감함을 보였다.
- aGender, CommonVoice, VoxCeleb2, Timit의 네 데이터셋을 모두 학습한 모델은 개별 데이터셋으로만 학습한 모델보다 약간이지만 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.