Skip to main content
QUICK REVIEW

[论文解读] An Ensemble Approach for Facial Expression Analysis in Video

Hong-Hai Nguyen, Van Thong Huynh|arXiv (Cornell University)|Mar 24, 2022
Emotion and Mood Recognition被引用 10
一句话总结

本文提出一种集成深度学习方法,利用来自RegNet、GRU和Transformer的多模态特征融合,结合局部注意力机制,实现视频中连续愉悦度-唤醒度估计。该方法在Aff-Wild2验证集上实现了0.507的平均组内一致性相关系数(CCC),性能优于先前方法和基线模型约两倍。

ABSTRACT

Human emotions recognization contributes to the development of human-computer interaction. The machines understanding human emotions in the real world will significantly contribute to life in the future. This paper will introduce the Affective Behavior Analysis in-the-wild (ABAW3) 2022 challenge. The paper focuses on solving the problem of the valence-arousal estimation and action unit detection. For valence-arousal estimation, we conducted two stages: creating new features from multimodel and temporal learning to predict valence-arousal. First, we make new features; the Gated Recurrent Unit (GRU) and Transformer are combined using a Regular Networks (RegNet) feature, which is extracted from the image. The next step is the GRU combined with Local Attention to predict valence-arousal. The Concordance Correlation Coefficient (CCC) was used to evaluate the model.

研究动机与目标

  • 提升在非受控、真实世界视频环境中的连续愉悦度-唤醒度估计性能。
  • 解决在情感行为分析中使用深度学习进行时序建模与特征表示的挑战。
  • 通过多模态特征融合与集成学习,提升训练效率与预测准确性。
  • 探究局部注意力机制在提升基于GRU的序列建模性能方面对情感识别的有效性。
  • 在ABAW3 2022愉悦度-唤醒度估计子挑战赛中实现最先进性能。

提出的方法

  • 使用在ImageNet上预训练并微调的RegNet主干网络提取视觉特征。
  • 通过将应用于序列面部特征的GRU和Transformer编码器的表征进行拼接,生成多模态特征。
  • 采用两阶段框架:首先,多模态融合生成增强特征;其次,结合局部注意力机制的GRU建模时序动态。
  • 使用K折交叉验证(K=5)训练单个模型,其预测结果通过集成方式提升鲁棒性。
  • 模型使用Adam优化器进行优化,基础初始学习率为0.001,训练共25个周期。
  • 损失通过GRU、Transformer和最终输出头的个体损失加权组合计算,CCC作为主要评估指标。

实验结果

研究问题

  • RQ1GRU与Transformer的多模态融合是否能提升视频中愉悦度-唤醒度估计的特征表示?
  • RQ2在GRU层中引入局部注意力机制是否能增强连续情感识别中的时序建模性能?
  • RQ3所提出的K折模型集成与单模型基线相比,在泛化能力和鲁棒性方面表现如何?
  • RQ4与传统主干网络(如ResNet)相比,使用RegNet特征在提升训练速度与准确性方面有多大优势?
  • RQ5所提方法是否能在Aff-Wild2基准上超越现有最先进模型,实现愉悦度-唤醒度估计的性能突破?

主要发现

  • 所提方法在Aff-Wild2验证集上实现了0.507的平均组内一致性相关系数(CCC),显著优于基线方法(0.24)。
  • K折模型的集成平均CCC达到0.465,表明其在个体折数上具有更高的稳定性和泛化能力。
  • 结合局部注意力机制的GRU模型达到0.507的CCC,相较于仅使用GRU(0.504)实现了微小但稳定的性能提升。
  • 使用RegNet特征的GRU与Transformer多模态融合实现了0.478的CCC,表明特征表示学习有效。
  • 该模型在相同基准上超越了先前最先进方法,包括Deng等人(0.494)和Zhang等人(0.495)。
  • 在动作单元检测任务中,该方法使用RegNet特征实现了0.533的F1分数,优于基线(0.39)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。