Skip to main content
QUICK REVIEW

[论文解读] Spatio-Temporal AU Relational Graph Representation Learning For Facial Action Units Detection

Zihan Wang, Siyang Song|arXiv (Cornell University)|Mar 19, 2023
Emotion and Mood Recognition被引用 5
一句话总结

本论文提出了一种用于面部动作单元(AU)检测的时空图学习框架,该框架利用掩码自编码器(MAE)预训练的面部表征编码器、AU特异性特征生成器以及时空图学习模块,以建模AU之间的空间关系和跨视频帧的时间动态。该方法在测试集上实现了51.3%的平均F1分数,在第五届ABAW竞赛中排名第四。

ABSTRACT

This paper presents our Facial Action Units (AUs) detection submission to the fifth Affective Behavior Analysis in-the-wild Competition (ABAW). Our approach consists of three main modules: (i) a pre-trained facial representation encoder which produce a strong facial representation from each input face image in the input sequence; (ii) an AU-specific feature generator that specifically learns a set of AU features from each facial representation; and (iii) a spatio-temporal graph learning module that constructs a spatio-temporal graph representation. This graph representation describes AUs contained in all frames and predicts the occurrence of each AU based on both the modeled spatial information within the corresponding face and the learned temporal dynamics among frames. The experimental results show that our approach outperformed the baseline and the spatio-temporal graph representation learning allows our model to generate the best results among all ablated systems. Our model ranks at the 4th place in the AU recognition track at the 5th ABAW Competition. Our code is publicly available at https://github.com/wzh125/ABAW-5.

研究动机与目标

  • 为解决真实视频中细微AU检测的挑战,包括数据不平衡和复杂的时空依赖性。
  • 联合建模不同AU之间的空间关系以及连续视频帧间的时间动态,以提升AU识别性能。
  • 通过预训练的面部表征编码器缓解Aff-Wild2数据集中AU标注不平衡导致的模型偏差。
  • 开发一种基于图的表征学习框架,显式建模AU关系和面部序列中的时间演化。
  • 在第五届野外情感行为分析(ABAW)竞赛中实现AU检测的最先进性能。

提出的方法

  • 使用在人脸数据库上预训练的掩码自编码器(MAE)从每个输入人脸图像中提取强而可泛化的面部表征。
  • AU特异性特征生成器从面部表征中提取任务特定特征,作为时空图中的节点特征。
  • 时空图学习(STGL)模块构建一个图结构,其中节点代表跨帧的AU,边编码AU之间的空间关系以及帧间的时间依赖性。
  • STGL模块通过同时利用同一帧内的空间邻居和同一AU序列中跨帧的时间邻居来更新每个AU节点,从而实现对空间和时间动态的联合建模。
  • 模型采用K近邻策略(K=4)定义空间和时间图连接,并通过消息传递机制在图中聚合特征。
  • 训练采用AdamW优化器,权重衰减为5e-4,学习率采用余弦衰减调度策略,并通过随机采样16帧片段并为较短片段填充空白帧的方式进行数据增强。

实验结果

研究问题

  • RQ1在数据不平衡设置下,预训练的掩码自编码器是否能提升面部表征学习以用于AU检测?
  • RQ2时空图学习模块在建模AU之间的空间关系和帧间时间依赖性方面是否具有高效性?
  • RQ3与单独建模空间或时间图结构相比,联合建模空间和时间图结构在多大程度上提升了AU检测性能?
  • RQ4与基于ImageNet的预训练相比,使用混合人脸数据集进行MAE预训练是否在AU检测任务中表现更优?
  • RQ5与最先进方法相比,该方法在真实世界AU检测基准上的表现如何?

主要发现

  • 所提方法在测试集上实现了51.3%的平均F1分数,在第五届ABAW竞赛中排名第四,优于基线模型(36.5%)和ME-Graph方法(51.0%)。
  • 消融实验表明,空间图学习和时间图学习均对性能有显著贡献,完整模型在验证集上达到54.3%的F1分数。
  • 在混合人脸数据集上进行预训练相比基于ImageNet的预训练,性能有所提升(54.3% F1 vs. 52.6% F1),表明通用预训练存在领域偏移问题。
  • 尽管整体得分略有差距,该模型在多个AU类别上优于第一名团队(Netease Fuxi),表明其在罕见AU检测中的鲁棒性。
  • 同时包含空间和时间图学习的模块带来了最大的性能提升,凸显了建模两类关系的重要性。
  • 在验证集上,该方法相比基线模型平均F1分数提升了15.3个百分点(从39.0提升至54.3),验证了所提框架的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。