[论文解读] Multi-label Transformer for Action Unit Detection
本文提出了一种用于动作单元(AU)检测的多标签Transformer架构,通过在面部区域上应用自注意力机制,并利用学习得到的AU标记与图像特征之间的交叉注意力机制,实现对每个AU相关面部区域的定位。该方法在ABAW3挑战赛中取得了53.8%的测试平均F1分数,通过基于注意力的特征选择以及结合频率加权和Dice损失处理类别不平衡,实现了性能提升。
Action Unit (AU) Detection is the branch of affective computing that aims at recognizing unitary facial muscular movements. It is key to unlock unbiased computational face representations and has therefore aroused great interest in the past few years. One of the main obstacles toward building efficient deep learning based AU detection system is the lack of wide facial image databases annotated by AU experts. In that extent the ABAW challenge paves the way toward better AU detection as it involves a 2M frames AU annotated dataset. In this paper, we present our submission to the ABAW3 challenge. In a nutshell, we applied a multi-label detection transformer that leverage multi-head attention to learn which part of the face image is the most relevant to predict each AU.
研究动机与目标
- 为解决面部图像中多标签动作单元检测的挑战,该挑战涉及局部肌肉运动及高AU间依赖性。
- 通过注意力机制学习每个AU最相关的面部区域,以提升AU检测性能。
- 通过基于频率的损失加权和Dice损失,缓解AU检测中的类别不平衡问题,其中大多数帧未显示AU激活。
- 通过在相关数据集(DISFA、BP4D)上进行预训练(使用掩码AU标注)并结合数据增强,提升性能。
- 在ABAW3挑战赛中验证所提出架构的有效性,该挑战赛是大规模、真实世界中的AU检测基准。
提出的方法
- 模型采用基于视觉Transformer的架构,通过图像块嵌入和位置编码处理面部图像。
- 在图像块上应用自注意力机制,以学习面部区域的上下文感知局部特征。
- 学习得到的AU标记通过交叉注意力机制关注图像特征,使模型能够为每个AU动态选择相关面部区域。
- 该架构在Transformer块堆叠中集成多头注意力、层归一化和前馈网络。
- 最终的投影头采用Sigmoid激活函数输出每个AU的概率,并通过20帧窗口的平滑处理来建模片段级别的AU事件。
- 训练采用混合损失函数,结合基于频率的类别权重的二元交叉熵损失和Dice损失,以应对长尾类别分布问题。
实验结果
研究问题
- RQ1具有AU标记与图像特征之间交叉注意力的多标签Transformer能否有效提升单个AU相关面部区域的定位能力?
- RQ2基于注意力的特征选择在捕捉AU激活的高度局部化和瞬时特性方面效果如何?
- RQ3在包含掩码AU标注的相关AU数据集(DISFA、BP4D)上进行预训练,能在多大程度上提升在ABAW3基准上的性能?
- RQ4结合基于频率的损失加权和Dice损失是否能显著提升类别不平衡AU检测的F1性能?
- RQ5能否通过时间平均有效将帧级预测平滑为片段级AU检测?
主要发现
- 该模型在ABAW3挑战赛中取得了53.8%的测试平均F1分数,是报告配置中表现最佳的提交结果。
- 通过20帧滑动平均平滑预测,显著提升了时间一致性与性能。
- 在DISFA和BP4D数据集上使用掩码AU标注进行预训练带来了性能提升,尽管表格中未量化具体增益。
- 基于频率的损失加权与Dice损失的结合,有效改善了长尾AU分布的处理,提升了F1分数。
- 数据增强技术(包括mixup及几何/颜色变换)提升了泛化能力与鲁棒性。
- 消融实验表明,若移除滑动平均或频率加权机制,性能将下降(分别降至52.7%和50.3%),证实了二者的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。