[论文解读] Multi-modal Multi-label Facial Action Unit Detection with Transformer
本文提出了一种基于视觉-音频变换器框架的多模态、多标签面部动作单元(AU)检测模型,引入了一种新颖的基于变换器的AU相关性模块,以提升分类性能。通过联合建模时空视觉特征与音频特征,并显式建模AU之间的依赖关系,该方法在ABAW 2022验证集上取得了0.518的F1分数,优于竞赛基线。
Facial Action Coding System is an important approach of facial expression analysis.This paper describes our submission to the third Affective Behavior Analysis (ABAW) 2022 competition. We proposed a transfomer based model to detect facial action unit (FAU) in video. To be specific, we firstly trained a multi-modal model to extract both audio and visual feature. After that, we proposed a action units correlation module to learn relationships between each action unit labels and refine action unit detection result. Experimental results on validation dataset shows that our method achieves better performance than baseline model, which verifies that the effectiveness of proposed network.
研究动机与目标
- 通过利用多模态(视觉与音频)输入,提升开放环境下多标签面部动作单元检测的性能。
- 通过加权二元交叉熵损失缓解AU检测中的类别不平衡问题。
- 通过建模动作单元标签之间的相关性,提升性能,这些标签之间具有高度依赖性。
- 开发一种基于变换器的联合视觉-音频表征学习框架,用于时空特征提取。
- 验证所提出的相关性模块在优化多标签AU预测中的有效性。
提出的方法
- 使用时空变换器(ST-Former)从面部裁剪图像中提取时空特征,结合卷积空间变换器与时间编码器。
- 使用独立的基于ResNet-18的模型处理音频梅尔频谱图,以提取听觉特征。
- AU相关性模块使用变换器编码器,基于来自12个独立全连接分支的特征,建模12个AU标签之间的关系。
- 将视觉分支与音频分支的特征拼接后,输入相关性模块以进行联合AU预测。
- 模型采用加权二元交叉熵损失进行训练,其中类别权重与每个AU正样本频率的倒数成正比。
- 训练分阶段进行:先对视觉主干网络进行预训练,随后联合音频与相关性模块进行微调。
实验结果
研究问题
- RQ1结合视觉与音频输入的多模态变换器模型是否能显著提升AU检测性能,优于单模态基线?
- RQ2通过基于变换器的模块显式建模AU间相关性,是否能提升多标签AU检测的准确性?
- RQ3所提出的时空变换器在捕捉面部序列中长程时空依赖关系方面效果如何?
- RQ4加权二元交叉熵损失在多大程度上缓解了AU检测中的类别不平衡问题?
- RQ5在Aff-Wild2验证集上,各组件(音频、视觉、相关性模块)对最终性能的贡献程度如何?
主要发现
- 所提出的联合听觉-视觉模型在ABAW 2022官方验证集上取得了0.518的F1分数,显著优于竞赛基线(0.39)。
- 当应用于视觉流时,AU相关性模块使性能提升了0.21个F1分数点;当应用于音频流时,提升达0.22个F1分数点。
- 与仅使用空间特征的模型相比,视觉分支中引入时间变换器使F1分数提升了0.21分。
- 仅使用视觉时空模型即达到0.501的F1分数,证明了时空建模的有效性。
- 音频分支单独使用时取得了0.344的中等F1分数,表明音频对AU检测有显著贡献。
- 消融实验确认,音频、视觉与相关性模块三个组件对最终性能提升具有累加性贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。