[论文解读] Multi-label Relation Modeling in Facial Action Units Detection
本文提出了一种用于面部动作单元(AU)检测的多标签关系建模方法,结合静态纹理与动态关键点特征。通过在循环分类框架中融合基于GRU的特征提取网络与查询学习的AU嵌入表,该方法在Aff-Wild2数据集上实现了0.56的验证加权F1分数,有效将共现AU建模为序列模式。
This paper describes an approach to the facial action units detections. The involved action units (AU) include AU1 (Inner Brow Raiser), AU2 (Outer Brow Raiser), AU4 (Brow Lowerer), AU6 (Cheek Raise), AU12 (Lip Corner Puller), AU15 (Lip Corner Depressor), AU20 (Lip Stretcher), and AU25 (Lip Part). Our work relies on the dataset released by the FG-2020 Competition: Affective Behavior Analysis In-the-Wild (ABAW). The proposed method consists of the data preprocessing, the feature extraction and the AU classification. The data preprocessing includes the detection of face texture and landmarks. The texture static and landmark dynamic features are extracted through neural networks and then fused as the feature latent representation. Finally, the fused feature is taken as the initial hidden state of a recurrent neural network with a trainable lookup AU table. The output of the RNN is the results of AU classification. The detected accuracy is evaluated with 0.5$ imes$accuracy + 0.5$ imes$F1. Our method achieve 0.56 with the validation data that is specified by the organization committee.
研究动机与目标
- 通过将共现AU建模为序列模式,提升面部动作单元检测性能。
- 通过融合静态纹理与基于动态关键点的运动特征,增强特征表示能力。
- 开发一种可训练的AU嵌入查找机制,实现多个标签间AU存在的联合学习。
- 解决在真实世界、非约束性视频数据中进行多标签、多分类AU检测的挑战。
- 通过端到端学习与后处理平滑,实现在AffectNet和Aff-Wild2数据集上的鲁棒性能。
提出的方法
- 使用预训练的面部语义分割模型裁剪面部区域并遮蔽背景,随后转换为灰度图与边缘图以提取纹理特征。
- 双输入卷积神经网络处理灰度图与边缘图,以捕捉局部AU区域相关性,最终特征图送入GRU以建模全局纹理上下文。
- 通过相邻时间帧间面部关键点的差异提取动态特征,使用带有Tanh激活函数的全连接网络以归一化尺度。
- 通过拼接方式融合静态与动态特征,形成统一的潜在表征用于AU分类。
- 基于查询的GRU网络使用可学习的AU嵌入(8×64矩阵)作为查询,迭代分类每个AU,且每轮AU查询后更新GRU状态。
- 最终使用二元分类器(Softmax)基于GRU输出预测每个AU的激活状态,通过端到端联合优化进行训练。
实验结果
研究问题
- RQ1如何有效融合静态与动态面部特征以提升多标签AU检测性能?
- RQ2将AU共现建模为序列过程是否能提升面部表情分析中的分类性能?
- RQ3在弱监督设置下,可学习的AU嵌入表在多标签分类中的增强程度如何?
- RQ4融合关键点运动特征与纹理特征对非约束性视频数据中鲁棒性的影响如何?
- RQ5与标准多标签分类头相比,使用循环查询机制的性能增益有多大?
主要发现
- 所提方法在Aff-Wild2数据集上使用0.5×准确率 + 0.5×F1的综合指标,实现了0.56的验证分数。
- 融合来自灰度图与边缘图的静态纹理特征,以及来自关键点差异的动态运动特征,提升了AU检测的鲁棒性。
- 使用基于查询的GRU网络与可学习AU嵌入表,能够有效建模多标签AU共现模式。
- 结合超参数调优与后处理平滑的端到端训练框架带来了稳定的性能提升。
- 该方法在真实世界、非约束性面部视频数据中表现出强大的泛化能力,尤其在AU1、AU2与AU4等共现AU上表现优异。
- 基于GRU的AU嵌入序列处理机制允许对预测进行迭代优化,从而提升对细微与重叠面部动作的检测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。