[论文解读] Facial Expression Recognition with Swin Transformer
该论文提出了一种基于三流Swin Transformer的模型,用于在野外的Aff-Wild2数据集上进行面部表情识别,融合了视觉、时间与音频模态。该方法引入了一种新颖的数据增强技术——半混合抖动(half-mix jittering),提升了在类别不平衡数据上的泛化能力,在验证集上取得了35.71的F1分数,较基线模型高出超过12分。
The task of recognizing human facial expressions plays a vital role in various human-related systems, including health care and medical fields. With the recent success of deep learning and the accessibility of a large amount of annotated data, facial expression recognition research has been mature enough to be utilized in real-world scenarios with audio-visual datasets. In this paper, we introduce Swin transformer-based facial expression approach for an in-the-wild audio-visual dataset of the Aff-Wild2 Expression dataset. Specifically, we employ a three-stream network (i.e., Visual stream, Temporal stream, and Audio stream) for the audio-visual videos to fuse the multi-modal information into facial expression recognition. Experimental results on the Aff-Wild2 dataset show the effectiveness of our proposed multi-modal approaches.
研究动机与目标
- 通过多模态数据提升在野外Aff-Wild2数据集上的面部表情识别性能。
- 通过一种新颖的数据增强策略,解决面部表情数据集中类别不平衡的问题。
- 在统一的多模态框架中,利用Swin Transformer在视觉、时间与音频流中的表征能力。
- 验证半混合抖动在提升模型对部分面部输入鲁棒性方面的有效性。
提出的方法
- 采用三流网络架构,视觉、时间与音频流分别使用独立的Swin Transformer编码器。
- 视觉流通过Swin Transformer Large主干网络处理单张裁剪后的面部图像。
- 时间流使用S3D卷积层,从每秒采样16帧的视频片段中提取时空特征。
- 音频流将音频信号转换为梅尔频谱图,再由Swin Transformer编码器处理。
- 在训练过程中应用半混合抖动,即用同一批次中的参考面部图像替换面部部分区域(左/右或上/下),采用可学习掩码与标签混合。
- 在推理阶段通过平均三个流的预测结果进行得分融合。
实验结果
研究问题
- RQ1基于Swin Transformer的多模态模型能否在非受限、野外的视频数据中有效识别面部表情?
- RQ2半混合抖动数据增强在类别不平衡的面部表情数据集上如何提升性能?
- RQ3与静态视觉输入相比,音频与时间特征在面部表情识别中的贡献是什么?
- RQ4所提出的三流架构结合晚期融合是否优于单流或早期融合的基线模型?
主要发现
- 所提出的三流模型在验证集上取得了35.71的F1分数,显著优于基线模型的23.00分。
- 仅视觉流即取得了34.74的高F1分数,表明Swin Transformer在单帧面部表情识别中具有强大性能。
- 加入时间与音频流后,性能从35.08(视觉+时间)提升至35.71(完整三流融合),表明各模态间存在互补信息。
- 半混合抖动提升了泛化能力,尤其对少数类(如愤怒、厌恶、恐惧与惊讶)有显著帮助,这些类别在增强过程中被用作参考图像。
- 模型对部分面部输入表现出鲁棒性,因为半混合抖动明确促使模型关注显著的面部区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。