[论文解读] Evaluation of Error and Correlation-Based Loss Functions For Multitask Learning Dimensional Speech Emotion Recognition
本文评估了在维度化语音情感识别的多任务学习中,基于误差的损失函数(MSE、MAE)与基于相关性的损失函数(CCC)的表现。基于两个数据集(IEMOCAP、MSP-IMPROV)和两种声学特征集(GeMAPS、pAA),研究结果表明,CCC损失在所有场景下均持续优于MSE和MAE,于愉悦度、唤醒度和支配度维度上均取得了更高的一致性相关系数(CCC)得分。其主要贡献在于实证验证了基于相关性的损失函数相较于传统的基于误差的损失函数,更适用于回归型维度化情感识别。
The choice of a loss function is a critical part of machine learning. This paper evaluated two different loss functions commonly used in regression-task dimensional speech emotion recognition, an error-based and a correlation-based loss functions. We found that using a correlation-based loss function with a concordance correlation coefficient (CCC) loss resulted in better performance than an error-based loss function with mean squared error (MSE) loss and mean absolute error (MAE), in terms of the averaged CCC score. The results are consistent with two input feature sets and two datasets. The scatter plots of test prediction by those two loss functions also confirmed the results measured by CCC scores.
研究动机与目标
- 评估不同损失函数(MSE、MAE、CCC)对维度化语音情感识别中多任务学习的影响。
- 确定基于相关性的损失函数(CCC)是否在情感识别的回归任务中比基于误差的损失函数(MSE、MAE)更有效。
- 评估在不同数据集(IEMOCAP、MSP-IMPROV)和声学特征集(GeMAPS、pAA)下性能的一致性。
- 验证假设:CCC损失因同时考虑相关性与偏差,可带来比MSE和MAE更优的模型泛化能力。
提出的方法
- 本研究采用多任务学习框架,利用深度神经网络联合预测三个情感维度:愉悦度、唤醒度和支配度(VAD)。
- 评估三种损失函数:均方误差(MSE)、平均绝对误差(MAE)以及一致性相关系数损失(1 − CCC),并对愉悦度和唤醒度应用类别权重以实现平衡。
- 使用两个数据集:IEMOCAP与MSP-IMPROV,采用说话人独立的测试划分(LOSO),并将标签标准化从[1,5]映射至[-1,1]。
- 提取两种高级统计特征集(HSF):一种来自GeMAPS(23个LLD),一种来自pAA(34个LLD),仅使用低层级描述符的均值与标准差。
- 通过三个维度的平均CCC评估模型性能,辅以各维度得分的单独分析及散点图用于可视化验证。
- 所有实验均采用相同的神经网络架构与超参数设置,以确保损失函数之间的公平比较。
实验结果
研究问题
- RQ1在多任务维度化语音情感识别中,使用基于相关性的损失函数(CCC)是否能带来优于基于误差的损失函数(MSE、MAE)的性能表现?
- RQ2CCC损失的性能优势是否在不同数据集和声学特征集之间保持一致?
- RQ3MSE、MAE与CCC损失的预测分布在与真实标签的对齐性与偏差方面有何差异?
- RQ4CCC损失是否可通过最小化回归输出中的相关性与位置偏差,提升模型泛化能力?
- RQ5在使用CCC损失时,通用型特征集(pAA)的性能是否与情感特异性特征集(GeMAPS)相当?
主要发现
- 在IEMOCAP数据集上使用GeMAPS特征时,CCC损失取得了0.400的平均CCC得分,显著高于MSE(0.310)与MAE(0.304)。
- 在MSP-IMPROV数据集上使用pAA特征时,CCC损失的平均CCC得分为0.340,高于MSE的0.305与MAE的0.324。
- 愉悦度-唤醒度预测的散点图显示,CCC损失的预测结果相较于MSE与MAE更贴近标准真实标签。
- 在所有四个场景(2个数据集 × 2个特征集)中均观察到性能一致性,CCC损失在所有情况下均持续优于基于误差的损失函数。
- 所有配置下的平均MSE得分几乎完全相同,表明MSE对模型差异不敏感,可能不适用于在多样化设置中追踪性能差异。
- 当使用CCC损失时,情感设计的GeMAPS与通用型pAA特征集之间未发现显著性能差距,表明该损失函数在不同特征类型间具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。