Skip to main content
QUICK REVIEW

[论文解读] Multi-modal Facial Action Unit Detection with Large Pre-trained Models for the 5th Competition on Affective Behavior Analysis in-the-wild

Yufeng Yin, Minh Trần|arXiv (Cornell University)|Mar 19, 2023
Face recognition and analysis被引用 5
一句话总结

本文提出了一种基于视觉、听觉和词汇特征的多模态面部动作单元(AU)检测框架,这些特征源自大规模预训练模型(Swin Transformer、GH-Feat、HuBERT、RoBERTa)。通过超分辨率和人脸对齐提升视觉特征质量,在Aff-Wild2验证集上实现了52.3%的F1分数,证明了多模态融合与数据预处理在真实场景下鲁棒AU检测中的有效性。

ABSTRACT

Facial action unit detection has emerged as an important task within facial expression analysis, aimed at detecting specific pre-defined, objective facial expressions, such as lip tightening and cheek raising. This paper presents our submission to the Affective Behavior Analysis in-the-wild (ABAW) 2023 Competition for AU detection. We propose a multi-modal method for facial action unit detection with visual, acoustic, and lexical features extracted from the large pre-trained models. To provide high-quality details for visual feature extraction, we apply super-resolution and face alignment to the training data and show potential performance gain. Our approach achieves the F1 score of 52.3% on the official validation set of the 5th ABAW Challenge.

研究动机与目标

  • 探究多模态信号是否能提升在不同真实场景条件下AU检测的鲁棒性。
  • 评估超分辨率与人脸对齐在提升视觉特征质量以用于AU检测方面的有效性。
  • 评估大规模预训练模型是否能在非约束环境下生成可泛化且具有判别性的特征表示用于AU检测。
  • 探索语音与文本模态特征对AU检测性能的贡献。

提出的方法

  • 使用Swin Transformer和GH-Feat编码器提取视觉特征,并在训练数据中应用超分辨率与人脸对齐,以减少与预训练分布之间的领域偏移。
  • 使用HuBERT提取语音特征,同时通过RoBERTa获取词汇特征,两者均提供高层语义与语调表征。
  • 在流水线早期进行多模态特征融合,随后通过GRU进行时序建模,并经线性投影以捕捉序列模式。
  • 训练一个多层感知机(MLP),从拼接并处理后的特征中预测AU标签。
  • 模型采用AUcorr方法,通过挖掘成对AU相关性来提升检测性能,方法为对预测概率取平均。
  • 进行消融实验以评估各模态与组件(包括视觉、语音、文本及时序特征)的贡献。
Figure 1 : Multi-modal method for facial action unit detection. The inputs from different modalities are passed through different large pre-trained models to extract high-level representations, in this case, Swin Transformer [ 23 ] and GH-Feat encoder [ 31 ] for vision, HuBERT [ 8 ] for audio, and R
Figure 1 : Multi-modal method for facial action unit detection. The inputs from different modalities are passed through different large pre-trained models to extract high-level representations, in this case, Swin Transformer [ 23 ] and GH-Feat encoder [ 31 ] for vision, HuBERT [ 8 ] for audio, and R

实验结果

研究问题

  • RQ1多模态信号是否能提升预训练模型在不同真实场景条件下AU检测的鲁棒性?
  • RQ2超分辨率与人脸对齐是否能有效减少因低质量视频帧导致的性能下降?
  • RQ3大规模预训练模型是否能在非约束环境下生成可靠且可泛化的特征表示用于AU检测?
  • RQ4语音与文本特征在多大程度上提升了AU检测性能?
  • RQ5通过后处理或特征融合,挖掘的AU相关性是否能增强检测性能?

主要发现

  • 所提出的多模态框架在官方Aff-Wild2验证集上实现了52.3%的F1分数,优于基线模型。
  • 超分辨率与人脸对齐显著提升了视觉特征质量,当在验证集上去除时F1分数下降2.5%,表明其重要性。
  • 语音模态对测试集性能贡献最为显著,排除后F1分数下降2.1%,表明其在泛化中的关键作用。
  • 通过GRU进行时序建模使测试集性能提升0.7%,证实了序列上下文在AU检测中的价值。
  • AUcorr在验证集上使AU24的性能提升13%,AU26提升5.2%,证明了基于相关性的后处理方法的有效性。
  • 文本模态贡献适中但稳定,使测试集F1分数提升0.8%,表明其与视觉和语音信息具有互补性。
(a) Aff-Wild2.
(a) Aff-Wild2.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。