Skip to main content
QUICK REVIEW

[论文解读] EmotiEffNet Facial Features in Uni-task Emotion Recognition in Video at ABAW-5 competition

Andrey V. Savchenko|arXiv (Cornell University)|Mar 16, 2023
Emotion and Mood Recognition被引用 15
一句话总结

该论文提出一个基于 EmotiEffNet 嵌入的在线视频情感识别管线,配合 MLP/LightAutoML 分类器和时序平滑,在 ABAW-5 的 Aff-Wild2 上改进 VA、FER 和 AU 指标。

ABSTRACT

In this article, the results of our team for the fifth Affective Behavior Analysis in-the-wild (ABAW) competition are presented. The usage of the pre-trained convolutional networks from the EmotiEffNet family for frame-level feature extraction is studied. In particular, we propose an ensemble of a multi-layered perceptron and the LightAutoML-based classifier. The post-processing by smoothing the results for sequential frames is implemented. Experimental results for the large-scale Aff-Wild2 database demonstrate that our model achieves a much greater macro-averaged F1-score for facial expression recognition and action unit detection and concordance correlation coefficients for valence/arousal estimation when compared to baseline.

研究动机与目标

  • 在 ABAW-5 约束下,提升野外帧级情感预测以改进 VA、FER 与 AU 任务。
  • 利用在 AffectNet 上预训练的 EmotiEffNet 面部嵌入,生成与 Aff-Wild2 偏差无关的帧级表示。
  • 评估简单但有效的分类器(MLP 和 LightAutoML 集成)并结合时序平滑于下游任务。
  • 对比基线 CNNs 及基于 EfficientNet 的方法以量化收益。
  • 提供可复现的工作流程并讨论未来改进,如音频整合与序列推理。

提出的方法

  • 从预训练的 EmotiEffNet 模型(EmotiEffNet-B0 或 MT-EmotiEffNet-B0)提取每帧嵌入 x(t) 和 logits l(t),这些模型已对 FER 和 VA 任务进行微调。
  • 将 logits l(t)、Valence V(t) 和 Arousal A(t) 连接成分类器的输入(MLP 和 LightAutoML),以预测 VA、FER 类别或 AU 标签。
  • 对于 VA,训练一个无隐藏层的 MLP,以最大化 Valence 和 Arousal 的 Concordance Correlation Coefficient,使用 tanh 激活。
  • 对于 FER 和 AU,训练具有一个隐藏层的 MLP;对 FER 使用 softmax;对 AU 检测使用 sigmoid 配合阈值。
  • 可选地在 ABAW-5 数据上微调 EmotiEffNet,并通过带有核大小 k 的盒形/中值滤波对帧级平滑以提高稳定性。
  • 尝试融合/集成(LightAutoML、MLP、微调模型)以及预训练仅 VA 或 预训练 logits 的设置以提升性能。
  • 平滑核大小 k 是一个关键超参数;更大 k(如 VA/AR 的 25–50)通常带来更好的 CCC,而 AU 检测则较小的 k 更佳(3–5)。
  • 提供可复现的工作流和公开的训练代码(GitHub)以便复现。

实验结果

研究问题

  • RQ1基于 EmotiEffNet 的面部特征是否能够在 ABAW-5 的 Aff-Wild2 上改进帧级 VA、FER 及 AU 的性能,相对于基线?
  • RQ2分类器选择(MLP vs LightAutoML)和特征输入(嵌入 vs logits)对下游任务性能有何影响?
  • RQ3时序平滑如何影响 VA、FER 与 AU 任务的预测稳定性和准确性?
  • RQ4在 ABAW-5 数据上微调 EmotiEffNet 是否比使用冻结的预训练嵌入有可测量的收益?
  • RQ5将多分类器和输入表征进行混合对单任务 ABAW-5 挑战有何好处?

主要发现

  • 使用 EmotiEffNet 嵌入和 MLP/LightAutoML 集成的管线显著提升 VA CCC 分数,相较于基线 ResNet-50 与先前的 EfficientNet 使用。
  • FER 的 macro F1-score 和准确率在有平滑和集成策略时明显提升,相对于 VGGFACE 基线有实质性收益。
  • AU 检测 macro F1-score 在基于 MLP 的方法和平滑下有所提升,优于若干基线,并显示从时间融合获益。
  • 最佳 VA 结果在 CCC_V 和 CCC_A 相对于基线及先前 EmotiEffNet 配置有显著提升,平滑核大小在 25–50 区间带来 CCC 增益。
  • AU 结果显示较小的平滑(k 约 3–5)更合适,因为帧变化快,集成/阈值优化进一步提升 F1。
  • 在各任务中,所提出的基于 EmotiEffNet 的工作流在验证数据上优于官方基线和以往的 EfficientNet 应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。