Skip to main content
QUICK REVIEW

[论文解读] Technical Report for Valence-Arousal Estimation on Affwild2 Dataset

I-Hsuan Li|arXiv (Cornell University)|May 4, 2021
Emotion and Mood Recognition参考文献 10被引用 5
一句话总结

本文提出了一种基于 MIMAMO Net 架构在 Aff-Wild2 数据集上的效价-唤醒度估计方法,利用时空特征并采用基于 GRU 的融合机制来建模微运动与宏运动。在重新选择的验证集上,其效价的组内一致性相关系数(CCC)为 0.415,唤醒度为 0.511,表明由于唤醒度与面部运动的相关性更强,因此在唤醒度估计方面性能更优。

ABSTRACT

In this work, we describe our method for tackling the valence-arousal estimation challenge from ABAW FG-2020 Competition. The competition organizers provide an in-the-wild Aff-Wild2 dataset for participants to analyze affective behavior in real-life settings. We use MIMAMO Net \cite{deng2020mimamo} model to achieve information about micro-motion and macro-motion for improving video emotion recognition and achieve Concordance Correlation Coefficient (CCC) of 0.415 and 0.511 for valence and arousal on the reselected validation set.

研究动机与目标

  • 为在真实世界数据中应对非受控、真实场景视频设置下的效价-唤醒度估计挑战。
  • 通过建模面部表情中的微运动与宏运动,提升情感识别性能。
  • 评估 MIMAMO Net 架构在大规模 Aff-Wild2 数据集上用于维度化情绪回归的有效性。
  • 探究真实世界视频数据中效价与唤醒度估计之间的性能差距。

提出的方法

  • 采用 MIMAMO Net 架构,一种双流 CNN-RNN 模型,分别处理空间特征与时间特征。
  • 在空间流中使用预训练的 ResNet50 从单帧图像中提取空间特征。
  • 在时间流中通过随时间生成相位差图像来捕捉时间动态。
  • 使用 GRU 网络融合空间与时间特征,以建模长距离依赖关系并提升帧级预测性能。
  • 实施数据平衡技术,但发现其对回归任务无效,因此将训练集与验证集合并用于交叉验证。
  • 实施帧插补策略:对初始缺失帧赋值为 -5,对非初始缺失帧则使用前序预测值进行传播。

实验结果

研究问题

  • RQ1MIMAMO Net 架构能否在非受控、真实场景的视频数据中有效估计连续的效价与唤醒度水平?
  • RQ2同时建模微运动与宏运动如何提升维度化情感识别的性能?
  • RQ3为何在真实场景视频设置中,唤醒度估计比效价估计更准确?
  • RQ4数据平衡技术在 Aff-Wild2 数据集上的回归性能提升方面有多大作用?

主要发现

  • 在重新选择的验证集上,该模型在效价估计上的组内一致性相关系数(CCC)为 0.415。
  • 该模型在唤醒度估计上的 CCC 为 0.511,优于效价估计。
  • 唤醒度估计性能更高,是因为其与可观察到的面部运动的相关性更强。
  • 数据平衡技术在回归任务中被证明无效,因此未在最终模型中应用。
  • 帧插补策略能有效处理缺失数据,其中初始缺失帧使用 -5 赋值,后续缺失帧则使用先前预测值进行填充。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。