Skip to main content
QUICK REVIEW

[论文解读] Facial Action Unit Recognition With Multi-models Ensembling

Wenqiang Jiang, Yannan Wu|arXiv (Cornell University)|Mar 24, 2022
Emotion and Mood Recognition被引用 8
一句话总结

本论文在 ABAW 2022 竞赛中提出了一种用于面部动作单元(AU)识别的多模型集成方法,通过引入改进的 IResNet100 搭建特征金字塔网络(FPN)、单阶段检测头(SSH)以及坐标注意力模块,以增强特征学习能力。通过结合在 Glint360K 和专有 AU/EXPR 数据集上预训练的模型,应用 ML-ROS 和批量采样进行数据平衡,并采用混合损失函数,该方法在 AU 验证集上取得了 0.731 的宏平均 F1 分数。

ABSTRACT

The Affective Behavior Analysis in-the-wild (ABAW) 2022 Competition gives Affective Computing a large promotion. In this paper, we present our method of AU challenge in this Competition. We use improved IResnet100 as backbone. Then we train AU dataset in Aff-Wild2 on three pertained models pretrained by our private au and expression dataset, and Glint360K respectively. Finally, we ensemble the results of our models. We achieved F1 score (macro) 0.731 on AU validation set.

研究动机与目标

  • 解决在真实世界野外数据中多标签面部动作单元识别存在的严重类别不平衡问题。
  • 通过改进主干网络架构,提升特征表示能力,以改善 AU 识别性能。
  • 通过整合多个预训练模型与集成策略,优化训练稳定性和泛化能力。
  • 设计一种鲁棒的损失函数,以考虑 Aff-Wild2 数据集中 AU 分布不均衡的影响。

提出的方法

  • 采用 IResNet100 作为主干网络,分别在 Glint360K 和两个专有数据集(AU 与表情)上进行预训练,以提升特征迁移能力。
  • 集成 FPN 和 SSH 模块,以保留并增强多尺度表示中的空间与纹理特征。
  • 在浅层与深层中引入坐标注意力模块,以提升空间特征的关注度与定位能力。
  • 设计一种混合损失函数,结合二元交叉熵损失与多标签损失,并引入类别特定权重(例如 w=[1,2,1,1,1,1,1,6,6,5,1,5]),以应对数据不平衡问题。
  • 实施批量采样策略,确保每个训练批次中所有 12 个 AU 均包含均衡的正负样本。
  • 通过在 logits 上应用滑动窗口进行时间平滑,提升视频输入中序列级 AU 预测的一致性。

实验结果

研究问题

  • RQ1在真实世界数据中存在极端标签不平衡的情况下,如何有效微调深度学习模型以实现面部动作单元识别?
  • RQ2如 FPN、SSH 和坐标注意力等架构改进,在多大程度上提升了 AU 识别性能?
  • RQ3在不同数据集上预训练的多个模型之间进行集成学习,是否能提升 ABAW 2022 AU 挑战中的泛化能力与性能表现?
  • RQ4所提出的混合损失函数在缓解 Aff-Wild2 数据集中长尾 AU 分布影响方面有多有效?
  • RQ5如 ML-ROS 和批量采样等数据平衡技术,对模型收敛性与 AU 特异性 F1 分数的贡献如何?

主要发现

  • 所提出的多模型集成策略在 ABAW 2022 AU 验证集上取得了 0.731 的宏平均 F1 分数,优于单一模型。
  • 使用 Glint360K 及专有 AU/EXPR 数据集的预训练权重,使性能相比从零开始训练提升了 14.4%。
  • 引入坐标注意力模块带来了最大的单体性能增益(F1 提升 4.4%),凸显其在注意力驱动特征学习中的有效性。
  • 结合 BCE 与带类别权重的多标签损失的混合损失函数,有效缓解了长尾 AU 分布的影响,尤其对稀有 AU(如 AU23 和 AU24)具有显著改善。
  • 通过 ML-ROS 和批量采样实现的数据平衡,使 F1 分数提升了 1.5%,证明了训练数据整理的重要性。
  • 消融实验表明,结合所有组件(FPN、SSH、坐标注意力、标签平滑与更大批量大小)可达到最高性能(F1 为 0.721),验证了完整流程的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。