QUICK REVIEW
[论文解读] Technical Report for Valence-Arousal Estimation on Affwild2 Dataset
I-Hsuan Li|arXiv (Cornell University)|May 4, 2021
Emotion and Mood Recognition参考文献 10被引用 5
一句话总结
本文提出了一种基于 MIMAMO Net 架构在 Aff-Wild2 数据集上的效价-唤醒度估计方法,利用时空特征并采用基于 GRU 的融合机制来建模微运动与宏运动。在重新选择的验证集上,其效价的组内一致性相关系数(CCC)为 0.415,唤醒度为 0.511,表明由于唤醒度与面部运动的相关性更强,因此在唤醒度估计方面性能更优。
ABSTRACT
In this work, we describe our method for tackling the valence-arousal estimation challenge from ABAW FG-2020 Competition. The competition organizers provide an in-the-wild Aff-Wild2 dataset for participants to analyze affective behavior in real-life settings. We use MIMAMO Net \cite{deng2020mimamo} model to achieve information about micro-motion and macro-motion for improving video emotion recognition and achieve Concordance Correlation Coefficient (CCC) of 0.415 and 0.511 for valence and arousal on the reselected validation set.
研究动机与目标
- 为在真实世界数据中应对非受控、真实场景视频设置下的效价-唤醒度估计挑战。
- 通过建模面部表情中的微运动与宏运动,提升情感识别性能。
- 评估 MIMAMO Net 架构在大规模 Aff-Wild2 数据集上用于维度化情绪回归的有效性。
- 探究真实世界视频数据中效价与唤醒度估计之间的性能差距。
提出的方法
- 采用 MIMAMO Net 架构,一种双流 CNN-RNN 模型,分别处理空间特征与时间特征。
- 在空间流中使用预训练的 ResNet50 从单帧图像中提取空间特征。
- 在时间流中通过随时间生成相位差图像来捕捉时间动态。
- 使用 GRU 网络融合空间与时间特征,以建模长距离依赖关系并提升帧级预测性能。
- 实施数据平衡技术,但发现其对回归任务无效,因此将训练集与验证集合并用于交叉验证。
- 实施帧插补策略:对初始缺失帧赋值为 -5,对非初始缺失帧则使用前序预测值进行传播。
实验结果
研究问题
- RQ1MIMAMO Net 架构能否在非受控、真实场景的视频数据中有效估计连续的效价与唤醒度水平?
- RQ2同时建模微运动与宏运动如何提升维度化情感识别的性能?
- RQ3为何在真实场景视频设置中,唤醒度估计比效价估计更准确?
- RQ4数据平衡技术在 Aff-Wild2 数据集上的回归性能提升方面有多大作用?
主要发现
- 在重新选择的验证集上,该模型在效价估计上的组内一致性相关系数(CCC)为 0.415。
- 该模型在唤醒度估计上的 CCC 为 0.511,优于效价估计。
- 唤醒度估计性能更高,是因为其与可观察到的面部运动的相关性更强。
- 数据平衡技术在回归任务中被证明无效,因此未在最终模型中应用。
- 帧插补策略能有效处理缺失数据,其中初始缺失帧使用 -5 赋值,后续缺失帧则使用先前预测值进行填充。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。