Skip to main content
QUICK REVIEW

[论文解读] Speech-based Age and Gender Prediction with Transformers

Felix Burkhardt, Johannes Wagner|arXiv (Cornell University)|Jun 29, 2023
Human Pose and Action Recognition被引用 4
一句话总结

本论文提出了一种基于语音的年龄与性别预测系统,采用微调后的wav2vec 2.0变换器模型,并在精心整理的数据集上进行训练,年龄预测的平均绝对误差(MAE)为7.1–10.8岁,性别分类准确率≥91.1%。该方法在年龄预测上比传统手工特征模型提升9%的UAR,在性别分类上提升4%的UAR,并公开了最佳模型与数据划分,以确保可复现性。

ABSTRACT

We report on the curation of several publicly available datasets for age and gender prediction. Furthermore, we present experiments to predict age and gender with models based on a pre-trained wav2vec 2.0. Depending on the dataset, we achieve an MAE between 7.1 years and 10.8 years for age, and at least 91.1% ACC for gender (female, male, child). Compared to a modelling approach built on handcrafted features, our proposed system shows an improvement of 9% UAR for age and 4% UAR for gender. To make our findings reproducible, we release the best performing model to the community as well as the sample lists of the data splits.

研究动机与目标

  • 通过整理并发布标准化的训练/验证/测试划分,解决语音中年龄与性别预测缺乏标准化公开数据集的问题。
  • 通过使用自监督预训练的变换器模型(wav2vec 2.0)而非传统手工特征方法,提升语音驱动的年龄与性别预测性能。
  • 研究模型在不同领域(同语料库内 vs. 跨语料库)之间的泛化能力,以及模型架构(多头 vs. 单头)与深度(变换器层数)的影响。
  • 为未来语音驱动的年龄与性别估计研究提供可复现的开源基线模型与数据划分。

提出的方法

  • 在四个公开可用的数据集(aGender、CommonVoice、VoxCeleb2和Timit)上微调预训练的wav2vec 2.0模型,先对年龄与性别标签进行整理与标准化。
  • 采用多任务学习设置,共享编码器,年龄预测(回归)与性别分类(分类)使用独立分支,实现联合预测。
  • 评估单头与多头架构,比较其在同语料库与跨语料库设置下的性能表现。
  • 系统性地调整变换器层数(从1到24层),以确定准确率与推理速度之间的最佳平衡。
  • 将年龄标签映射为离散类别(儿童、青年、成人、老年),以与2010年语音副语言挑战赛基线进行对比。
  • 通过GitHub仓库向社区发布性能最佳的模型与数据划分,确保研究可复现。
Figure 1: Distribution of speaker age (#samples) in the datasets for the three splits ( CommonVoice age in mid-decades).
Figure 1: Distribution of speaker age (#samples) in the datasets for the three splits ( CommonVoice age in mid-decades).

实验结果

研究问题

  • RQ1微调后的wav2vec 2.0变换器模型在年龄与性别预测方面相较于传统手工特征系统表现如何?
  • RQ2在准确率与推理效率之间取得最佳平衡时,年龄与性别预测的最优变换器层数是多少?
  • RQ3在不同数据集上,模型在同语料库与跨语料库设置下的性能表现有何差异?
  • RQ4情绪化语音在多大程度上会降低在中性语音数据上训练的模型性能?
  • RQ5统一模型能否比独立模型更有效地联合预测年龄与性别?其表现与特定任务基线相比如何?

主要发现

  • 所提出的基于wav2vec 2.0的模型在不同数据集上的年龄预测平均绝对误差(MAE)为7.1至10.8岁,显著优于2010年语音副语言挑战赛的基线模型。
  • 在性别分类(女性、男性、儿童)任务中,模型准确率至少达到91.1%,在柏林情绪语音数据库的中性样本上达到96.04%的UAR。
  • 与使用手工特征的基线系统相比,该模型在年龄预测上提升了9个百分点的UAR,在性别分类上提升了4个百分点的UAR。
  • 使用六层变换器时,在性能与推理速度之间达到最佳平衡,参数量减少3.5倍,推理时间减少3倍。
  • 在情绪化语音上性能下降,MAE升至8.35(中性样本为5.94),表明对情绪语调较为敏感。
  • 在全部四个数据集(aGender、CommonVoice、VoxCeleb2、Timit)上联合训练的模型,相较于仅在单一数据集上训练的模型,表现出微小但一致的性能提升。
Figure 2: Proposed architecture built on wav2vec 2.0.
Figure 2: Proposed architecture built on wav2vec 2.0.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。