Skip to main content
QUICK REVIEW

[论文解读] Multi Modal Facial Expression Recognition with Transformer-Based Fusion Networks and Dynamic Sampling

Jun-Hwa Kim, Nam‐Ho Kim|arXiv (Cornell University)|Mar 15, 2023
Emotion and Mood Recognition被引用 5
一句话总结

该论文提出了一种基于Transformer的多模态融合网络,通过结合音频和图像特征以提升面部表情识别性能,采用带有交叉注意力机制和动态采样的模态融合模块(MFM),以处理时序动态性和类别不平衡问题。该方法在ABAW 2023验证集上取得了27.77的F1分数,优于单模态基线模型。

ABSTRACT

Facial expression recognition is an essential task for various applications, including emotion detection, mental health analysis, and human-machine interactions. In this paper, we propose a multi-modal facial expression recognition method that exploits audio information along with facial images to provide a crucial clue to differentiate some ambiguous facial expressions. Specifically, we introduce a Modal Fusion Module (MFM) to fuse audio-visual information, where image and audio features are extracted from Swin Transformer. Additionally, we tackle the imbalance problem in the dataset by employing dynamic data resampling. Our model has been evaluated in the Affective Behavior in-the-wild (ABAW) challenge of CVPR 2023.

研究动机与目标

  • 通过整合音频与视觉模态,超越仅使用图像的方法,提升面部表情识别的准确性。
  • 通过动态数据重采样和多数类的子采样,解决Aff-Wild2数据集中类别不平衡的问题。
  • 通过使用以每帧为中心的多个动态音频窗口大小,建模面部表情的时序动态特性。
  • 开发一种可学习的融合机制,以在特征融合过程中自适应地加权音频与图像模态的重要性。
  • 通过基于Swin Transformer的架构,在ABAW 2023 AffectNet野外挑战赛中实现最先进性能。

提出的方法

  • 分别使用Tiny Swin Transformer提取音频和图像特征。
  • 模态融合模块(MFM)使用交叉注意力机制:音频特征查询图像特征,反之亦然,以实现模态感知的融合。
  • 将交叉注意力的融合输出(Y_IA 和 Y_AI)拼接后,通过两个额外的Transformer层生成 Y_T。
  • 使用三种不同的时间窗口大小(小:31帧,中:47帧,大:63帧)以捕捉每帧周围的动态面部表情变化。
  • 动态采样通过排除中心帧标签匹配率低于80%、65%或50%的窗口,确保标签一致性。
  • 通过子采样多数类(如“Happiness”)而保留所有少数类样本,缓解类别不平衡问题。

实验结果

研究问题

  • RQ1通过可学习注意力机制实现音视频融合,是否能超越仅使用图像的模型,提升面部表情识别性能?
  • RQ2对音频数据采用动态窗口化处理,如何影响在时序变化较大的面部表情中的识别性能?
  • RQ3动态重采样与子采样策略在多大程度上能减少在真实世界数据集中对不平衡类别的过拟合?
  • RQ4所提出的MFM结合交叉注意力是否优于简单的早期或晚期融合方法在多模态FER中的表现?
  • RQ5在存在类别不平衡的情况下,各模态(图像、音频、融合)对最终预测的贡献程度如何?

主要发现

  • 所提模型在验证集上取得27.77的F1分数,显著优于仅使用图像的基线模型(23.00)和仅使用音频的模型(14.12)。
  • 仅使用融合表示(Y_T)即达到25.09的F1分数,证明MFM在整合多模态线索方面的有效性。
  • 图像、音频与融合特征的集成模型表现最佳,表明各模态间存在互补信息。
  • 采用基于阈值的窗口一致性动态采样显著提升了在野外数据上的训练稳定性和模型泛化能力。
  • 对多数类(如“Happiness”)进行子采样有助于减少过拟合,并在不损失整体准确率的前提下提升了少数类的性能。
  • Swin-Tiny主干网络结合对数梅尔倒谱图与224×224输入分辨率,在模态特定特征提取与融合任务中均表现高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。