[论文解读] SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech
本文提出SEGAA,一种多输出深度学习模型,通过统一架构联合预测语音中的年龄、性别和情绪。通过利用共享特征提取器和任务特定分支,SEGAA在性能上表现优异——性别检测准确率达99%,同时有效建模变量间的相互依赖关系,在运行时效率和误差稳定性方面优于串行模型和独立模型。
The interpretation of human voices holds importance across various applications. This study ventures into predicting age, gender, and emotion from vocal cues, a field with vast applications. Voice analysis tech advancements span domains, from improving customer interactions to enhancing healthcare and retail experiences. Discerning emotions aids mental health, while age and gender detection are vital in various contexts. Exploring deep learning models for these predictions involves comparing single, multi-output, and sequential models highlighted in this paper. Sourcing suitable data posed challenges, resulting in the amalgamation of the CREMA-D and EMO-DB datasets. Prior work showed promise in individual predictions, but limited research considered all three variables simultaneously. This paper identifies flaws in an individual model approach and advocates for our novel multi-output learning architecture Speech-based Emotion Gender and Age Analysis (SEGAA) model. The experiments suggest that Multi-output models perform comparably to individual models, efficiently capturing the intricate relationships between variables and speech inputs, all while achieving improved runtime.
研究动机与目标
- 解决使用单一统一模型联合预测语音中年龄、性别和情绪的空白。
- 通过引入多输出架构,克服串行模型中误差在各阶段传播的局限性。
- 通过在共享表示中建模年龄、性别和情绪之间的相互依赖关系,提升效率和预测性能。
- 证明多输出学习可达到或超越独立模型的性能,同时降低计算开销。
- 为医疗保健、客户服务和心理健康监测等实际应用,构建一个鲁棒且可扩展的框架。
提出的方法
- SEGAA模型采用共享的卷积神经网络(CNN)主干网络,从原始音频输入中提取共享的语音表征。
- 在共享特征提取器上连接三个独立的任务特定分支:一个用于年龄回归,一个用于性别分类,一个用于情绪分类。
- 模型通过端到端训练,使用多任务损失函数,结合均方误差(MSE)用于年龄,类别交叉熵用于性别,交叉熵用于情绪。
- 采用Nadam优化器以提升收敛性和泛化能力,尤其在多输出设置中表现更优。
- 训练数据通过合并CREMA-D和EMO-DB数据集构建,确保所有三个标签(年龄、性别、情绪)均存在。
- 通过准确率、精确率、召回率和F1值对模型性能进行评估,所有三项任务均使用混淆矩阵分析错误模式。

实验结果
研究问题
- RQ1统一的多输出深度学习模型能否在语音中预测年龄、性别和情绪方面实现与独立模型相当或更优的性能?
- RQ2与联合预测相比,串行模型(如情绪→性别→年龄)中的误差传播如何影响整体预测准确率?
- RQ3在联合建模时,年龄、性别和情绪之间的相互依赖关系在多大程度上提升了模型性能?
- RQ4与独立模型或串行模型相比,所提出的多输出架构是否保持了高效率和低延迟?
- RQ5在年龄分布不均衡的情况下,特别是对60岁和70岁等代表性不足的人群,模型表现如何?
主要发现
- 多输出SEGAA模型在性别检测中达到99%的准确率,优于独立模型,展现出强大的泛化能力。
- 在情绪预测方面,多输出SEGAA模型达到96%的准确率,但‘中性’和‘焦虑/恐惧’类别的表现略低,主要受类别不平衡影响。
- 模型在年龄预测中保持了高性能,但因60至70岁年龄段数据稀缺,该群体的准确率略有下降。
- 与串行模型(如情绪→性别→年龄)相比,多输出SEGAA模型显著降低了误差传播,并获得了更优的整体F1分数。
- 尽管独立模型在准确率上略占优势,多输出SEGAA模型在运行时效率和稳定性方面表现更优,更适合实时应用。
- 混淆矩阵证实,无论是独立模型还是多输出SEGAA模型,其误分类率均较低,且多输出版本在所有类别中均表现出一致的性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。