[论文解读] EmotiEffNet Facial Features in Uni-task Emotion Recognition in Video at ABAW-5 competition
该论文提出一个基于 EmotiEffNet 嵌入的在线视频情感识别管线,配合 MLP/LightAutoML 分类器和时序平滑,在 ABAW-5 的 Aff-Wild2 上改进 VA、FER 和 AU 指标。
In this article, the results of our team for the fifth Affective Behavior Analysis in-the-wild (ABAW) competition are presented. The usage of the pre-trained convolutional networks from the EmotiEffNet family for frame-level feature extraction is studied. In particular, we propose an ensemble of a multi-layered perceptron and the LightAutoML-based classifier. The post-processing by smoothing the results for sequential frames is implemented. Experimental results for the large-scale Aff-Wild2 database demonstrate that our model achieves a much greater macro-averaged F1-score for facial expression recognition and action unit detection and concordance correlation coefficients for valence/arousal estimation when compared to baseline.
研究动机与目标
- 在 ABAW-5 约束下,提升野外帧级情感预测以改进 VA、FER 与 AU 任务。
- 利用在 AffectNet 上预训练的 EmotiEffNet 面部嵌入,生成与 Aff-Wild2 偏差无关的帧级表示。
- 评估简单但有效的分类器(MLP 和 LightAutoML 集成)并结合时序平滑于下游任务。
- 对比基线 CNNs 及基于 EfficientNet 的方法以量化收益。
- 提供可复现的工作流程并讨论未来改进,如音频整合与序列推理。
提出的方法
- 从预训练的 EmotiEffNet 模型(EmotiEffNet-B0 或 MT-EmotiEffNet-B0)提取每帧嵌入 x(t) 和 logits l(t),这些模型已对 FER 和 VA 任务进行微调。
- 将 logits l(t)、Valence V(t) 和 Arousal A(t) 连接成分类器的输入(MLP 和 LightAutoML),以预测 VA、FER 类别或 AU 标签。
- 对于 VA,训练一个无隐藏层的 MLP,以最大化 Valence 和 Arousal 的 Concordance Correlation Coefficient,使用 tanh 激活。
- 对于 FER 和 AU,训练具有一个隐藏层的 MLP;对 FER 使用 softmax;对 AU 检测使用 sigmoid 配合阈值。
- 可选地在 ABAW-5 数据上微调 EmotiEffNet,并通过带有核大小 k 的盒形/中值滤波对帧级平滑以提高稳定性。
- 尝试融合/集成(LightAutoML、MLP、微调模型)以及预训练仅 VA 或 预训练 logits 的设置以提升性能。
- 平滑核大小 k 是一个关键超参数;更大 k(如 VA/AR 的 25–50)通常带来更好的 CCC,而 AU 检测则较小的 k 更佳(3–5)。
- 提供可复现的工作流和公开的训练代码(GitHub)以便复现。
实验结果
研究问题
- RQ1基于 EmotiEffNet 的面部特征是否能够在 ABAW-5 的 Aff-Wild2 上改进帧级 VA、FER 及 AU 的性能,相对于基线?
- RQ2分类器选择(MLP vs LightAutoML)和特征输入(嵌入 vs logits)对下游任务性能有何影响?
- RQ3时序平滑如何影响 VA、FER 与 AU 任务的预测稳定性和准确性?
- RQ4在 ABAW-5 数据上微调 EmotiEffNet 是否比使用冻结的预训练嵌入有可测量的收益?
- RQ5将多分类器和输入表征进行混合对单任务 ABAW-5 挑战有何好处?
主要发现
- 使用 EmotiEffNet 嵌入和 MLP/LightAutoML 集成的管线显著提升 VA CCC 分数,相较于基线 ResNet-50 与先前的 EfficientNet 使用。
- FER 的 macro F1-score 和准确率在有平滑和集成策略时明显提升,相对于 VGGFACE 基线有实质性收益。
- AU 检测 macro F1-score 在基于 MLP 的方法和平滑下有所提升,优于若干基线,并显示从时间融合获益。
- 最佳 VA 结果在 CCC_V 和 CCC_A 相对于基线及先前 EmotiEffNet 配置有显著提升,平滑核大小在 25–50 区间带来 CCC 增益。
- AU 结果显示较小的平滑(k 约 3–5)更合适,因为帧变化快,集成/阈值优化进一步提升 F1。
- 在各任务中,所提出的基于 EmotiEffNet 的工作流在验证数据上优于官方基线和以往的 EfficientNet 应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。