Skip to main content
QUICK REVIEW

[论文解读] Multiple Emotion Descriptors Estimation at the ABAW3 Challenge

Didan Deng|arXiv (Cornell University)|Mar 24, 2022
Emotion and Mood Recognition被引用 4
一句话总结

该论文提出SMM-EmotionNet,一种新颖的多任务深度学习架构,基于心理学理论,分别建模面部动作单元(sign vehicles)和情感信息(效价、唤醒度、离散情绪)。通过为sign vehicles和message分别设计独立分支,并应用时间平滑处理,该模型在ABAW3挑战赛中实现了最先进性能,在所有指标上均优于单任务和多任务基线模型。

ABSTRACT

To describe complex emotional states, psychologists have proposed multiple emotion descriptors: sparse descriptors like facial action units; continuous descriptors like valence and arousal; and discrete class descriptors like happiness and anger. According to Ekman and Friesen, 1969, facial action units are sign vehicles that convey the emotion message, while discrete or continuous emotion descriptors are the messages perceived and expressed by human. In this paper, we designed an architecture for multiple emotion descriptors estimation in participating the ABAW3 Challenge. Based on the theory of Ekman and Friesen, 1969, we designed distinct architectures to measure the sign vehicles (i.e., facial action units) and the message (i.e., discrete emotions, valence and arousal) given their different properties. The quantitative experiments on the ABAW3 challenge dataset has shown the superior performance of our approach over two baseline models.

研究动机与目标

  • 解决在视频序列中同时估计多种情感描述符(面部动作单元(AUs)、效价/唤醒度(VA)、离散情绪)的挑战。
  • 将心理学理论(Ekman & Friesen, 1969)融入模型架构设计,基于其观察者依赖性和行为特性差异,区分sign vehicles(AUs)与情感message(EXPR, VA)。
  • 通过引入心理学先验知识来正则化特征学习,减少情感估计中的观察者间差异,从而在低标注数据设置下提升性能。
  • 通过简单的平滑处理探索情感特征的时间建模,以降低噪声并提升序列预测的一致性。

提出的方法

  • 设计双分支架构:一个分支用于sign vehicles(AUs),采用源自Jacob & Stenger (2021) 的内部和跨AUs注意力机制;另一分支用于情感message(EXPR, VA),通过基于区域的特征投影至共享message空间。
  • 将来自不同面部区域的视觉特征投影至共享message空间,并进行平均,以在情感message上达成共识,减少观察者依赖性带来的差异。
  • 使用递归滤波器进行时间平滑:$\Lambda_t = \frac{1}{1+\mu}(\epsilon_t + \mu\Lambda_{t-1})$,其中$\mu$通过网格搜索调优,以优化AUs、EXPR和VA任务的性能。
  • 使用共享特征提取器(如InceptionV3或VGG-Face),随后接针对不同任务的全连接头,分别用于AUs检测、离散情绪分类和连续VA回归。
  • 训练模型时采用余弦退火学习率调度,共300,000次迭代,分类任务使用交叉熵损失,回归任务使用均方误差损失。
  • 通过组合F1(用于AUs和EXPR)与CCC(用于VA)的多任务损失进行优化,最终评估指标中各项损失权重相等。

实验结果

研究问题

  • RQ1如何在深度学习架构中有效建模sign vehicles(如AUs)与情感message(如效价、唤醒度、离散情绪)之间的心理学差异?
  • RQ2将sign vehicles与情感message的学习过程分离,是否能提升多任务情感描述符估计的性能,尤其是在标注稀疏的情况下?
  • RQ3在message和sign vehicle空间中对特征进行时间平滑,是否能增强模型在序列情感识别任务中的鲁棒性与性能?
  • RQ4在情感估计中引入心理学先验(如观察者依赖性感知、AUs共现性)在多大程度上能提升泛化能力并减少观察者间差异?

主要发现

  • 所提出的SMM-EmotionNet在ABAW3挑战赛的AUs检测任务中,验证集F1-AU得分为0.548,优于基线InceptionV3模型(0.536)和VGG-Face(0.39)。
  • 在离散情绪分类任务中,模型取得0.518的宏平均F1分数,超过InceptionV3基线(0.489)和VGG-Face(0.23)。
  • 在连续情感预测任务中,模型在效价和唤醒度上的CCC分别达到0.447和0.499,优于InceptionV3基线(分别为0.441和0.485)。
  • 时间平滑方法使多任务评估指标(公式9)在验证集上从1.539(静态)提升至1.664,在测试集上从1.104提升至1.113,表明在各项任务中均取得一致提升。
  • 三折交叉验证显示,最优平滑超参数为:AU的$\mu=7$,EXPR与VA的$\mu=9$,其中第二折的CCC-VA达到最高值0.577。
  • 通过在message空间中融合多个面部区域的共识,模型展现出更优的泛化能力与鲁棒性,尤其在处理模糊或冲突的面部线索时表现更佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。