[论文解读] Joint gender and age estimation based on speech signals using x-vectors and transfer learning
该论文提出了一种基于x-vectors和迁移学习的联合性别与年龄估计系统,用更深的QuartzNet架构替代了标准的TDNN。在VoxCeleb和Common Voice数据集上进行预训练显著提升了性能,在TIMIT数据集上取得了最先进结果,男性平均绝对误差(MAE)为5.12年,女性为5.29年,性别分类准确率达到99.6%。
In this paper we extend the x-vector framework for the task of speaker's age estimation and gender classification. In particular, we replace the baseline multilayer-TDNN architecture with QuartzNet, a convolutional architecture that has gained success in the field of speech recognition. We further propose a two-staged transfer learning scheme, utilizing large scale speech datasets: VoxCeleb and Common Voice, and usage of multitask learning to allow for joint age estimation and gender classification with a single system. We train and evaluate the performance on the TIMIT dataset. The proposed transfer learning scheme yields consecutive performance improvements in terms of both age estimation error and gender classification accuracy and the best performing system achieves new state-of-the-art results on the task of age estimation on the TIMIT TEST dataset with MAE of 5.12 and 5.29 years and RMSE of 7.24 and 8.12 years for male and female speakers respectively while maintaining a gender classification accuracy of 99.6%.
研究动机与目标
- 通过在语音信号上使用深度学习提升联合说话人年龄估计与性别分类的准确性。
- 用更深的QuartzNet架构替代标准的TDNN-based x-vector架构,以获得更好的特征表示。
- 探究利用大规模语音数据集(VoxCeleb和Common Voice)进行迁移学习在低资源环境下年龄与性别估计中的有效性。
- 在TIMIT数据集上实现年龄估计与性别分类的最先进性能。
- 证明联合回归与分类的多任务学习可提升模型泛化能力与性能。
提出的方法
- 系统采用基于QuartzNet的神经网络作为x-vector嵌入器,替代传统的TDNN架构。
- 该嵌入器通过卷积模块、残差连接和统计池化(均值与标准差)从可变长度语音语句中提取固定大小的嵌入。
- 采用两阶段迁移学习方案:首先在VoxCeleb上进行语音识别的预训练,然后在TIMIT上通过联合年龄回归与性别分类进行微调。
- 在Common Voice上进行额外预训练可进一步提升性能,尤其在MFCC特征上效果更显著。
- 前端头部分为两个全连接分支:一个用于年龄回归,一个用于性别分类,通过多任务学习联合训练。
- 模型使用NVIDIA NeMo框架在TIMIT数据集上进行训练与评估,采用标准的训练-测试划分。
实验结果
研究问题
- RQ1基于更深层的QuartzNet架构的x-vector能否在联合年龄与性别估计任务中超越标准的TDNN-based x-vector?
- RQ2从VoxCeleb和Common Voice等大规模语音数据集进行迁移学习,在TIMIT上提升低资源环境下的年龄与性别估计效果如何?
- RQ3与单任务方法相比,联合进行年龄回归与性别分类的多任务学习是否能带来性能提升?
- RQ4不同输入特征(MFCC与梅尔频谱图)对联合估计系统最终性能有何影响?
- RQ5所提出的两阶段迁移学习方案能否在TIMIT数据集上实现年龄估计与性别分类的最先进结果?
主要发现
- 所提系统在TIMIT测试集上实现了新的最先进平均绝对误差(MAE):男性为5.12年,女性为5.29年。
- 均方根误差(RMSE)降低至男性7.24年、女性8.12年,相比先前工作有显著提升。
- 性别分类准确率达到99.6%,即使在联合训练年龄与性别任务下也表现出强大性能。
- 仅在VoxCeleb上进行预训练即可提升性能,而额外在Common Voice上进行预训练可获得进一步增益。
- 基于MFCC的系统在双阶段预训练(VoxCeleb + Common Voice)下表现最佳,优于以往的DNN-based与特征工程方法。
- 基于QuartzNet的嵌入器架构在年龄估计与性别分类任务中均持续优于标准的TDNN-based x-vector。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。