[论文解读] Analyzing the Affect of a Group of People Using Multi-modal Framework
本文提出了一种多模态框架,通过一种新颖的信息聚合方法融合面部、上半身和场景级线索,实现群体级情绪识别(GER)。该方法在两个具有挑战性的数据库上实现了最先进性能,在 HAPPEI 上的平均绝对误差(MAE)为 0.4835,在 GAFF 上的准确率为 66.67%,表明多模态融合显著提升了在真实、非受限环境中的鲁棒性和准确性。
Millions of images on the web enable us to explore images from social events such as a family party, thus it is of interest to understand and model the affect exhibited by a group of people in images. But analysis of the affect expressed by multiple people is challenging due to varied indoor and outdoor settings, and interactions taking place between various numbers of people. A few existing works on Group-level Emotion Recognition (GER) have investigated on face-level information. Due to the challenging environments, face may not provide enough information to GER. Relatively few studies have investigated multi-modal GER. Therefore, we propose a novel multi-modal approach based on a new feature description for understanding emotional state of a group of people in an image. In this paper, we firstly exploit three kinds of rich information containing face, upperbody and scene in a group-level image. Furthermore, in order to integrate multiple person's information in a group-level image, we propose an information aggregation method to generate three features for face, upperbody and scene, respectively. We fuse face, upperbody and scene information for robustness of GER against the challenging environments. Intensive experiments are performed on two challenging group-level emotion databases to investigate the role of face, upperbody and scene as well as multi-modal framework. Experimental results demonstrate that our framework achieves very promising performance for GER.
研究动机与目标
- 解决在因遮挡、光照和姿态变化导致面部检测常失败的真实非受限环境中进行群体级情绪识别的挑战。
- 探究在面部信息不可靠时,上半身和场景级线索在增强情绪识别方面的互补作用。
- 开发一种鲁棒的信息聚合方法,从群体图像中的多个个体中编码集体情绪状态。
- 设计并评估一种整合面部、上半身和场景特征的多模态融合框架,以提升 GER 性能。
- 在两个具有挑战性的数据库——HAPPEI 和 GAFF 上验证该框架,涵盖回归(幸福强度)和分类(正面/中性/负面)任务。
提出的方法
- 该框架提取三类特征:面部级(基于面部表情)、上半身级(基于姿态和姿势)和场景级(基于上下文环境线索)。
- 提出一种信息聚合方法,用于从多个个体中编码集体情绪状态,将个体级特征转化为群体级表征。
- 采用多核学习(MKL)的多模态融合策略,结合面部、上半身和场景特征,并引入改进的局部化 MKL 方法以提升泛化能力。
- 系统采用混合自下而上(个体属性)和自上而下(场景和群体结构)建模方法,受社会心理学原理启发。
- 使用回归(HAPPEI 上的平均绝对误差)和分类(GAFF 上的识别准确率)指标对框架进行评估。
- 在 HAPPEI 数据库上进行超参数调优,并将结果应用于 GAFF 数据库,确保跨数据集的模型配置一致性。
实验结果
研究问题
- RQ1当因真实世界挑战导致面部检测失败时,上半身和场景级特征是否能提升群体级情绪识别性能?
- RQ2面部、上半身和场景信息的多模态融合如何增强在非受限环境下的群体情绪识别的鲁棒性和准确性?
- RQ3在多样化社交场景中,面部、上半身和场景模态对群体级情感预测的相对贡献是什么?
- RQ4所提出的的信息聚合方法是否能有效从群体图像中的多个个体中编码集体情绪状态?
- RQ5所提出的多模态框架与现有最先进方法(如 GEM 和基于 CCRF 的模型)相比,在基准数据集上的表现如何?
主要发现
- 所提出的多模态框架在 HAPPEI 数据库上实现了 0.4835 的平均绝对误差(MAE),优于所有单模态基线模型和现有 GEM 模型。
- 仅使用面部特征的性能(MAE = 0.5187)与最先进 GEM 模型相当,但多模态融合将 MAE 降低 0.0457,表明显著改进。
- 上半身和场景特征的引入对性能有显著贡献,仅使用场景特征在 HI 核中即达到 0.7273 的 MAE,表明其在上下文感知情绪推理中的价值。
- 在 GAFF 数据库上,多模态系统实现了 66.67% 的识别准确率,优于仅使用面部特征(58.33%)和仅使用上半身特征(46.57%)的基线,且接近更复杂特征组合(67.64%)的性能。
- 所提出的信息聚合方法通过将个体级线索整合为统一表征,有效捕捉了群体级情感,增强了在复杂环境中的鲁棒性。
- 结果证实,多模态融合对于鲁棒的群体级情绪识别至关重要,尤其在面部数据因遮挡、姿态或光照变化而不可靠时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。