[论文解读] MAE-DFER: Efficient Masked Autoencoder for Self-supervised Dynamic Facial Expression Recognition
MAE-DFER 提出了一种用于动态面部表情识别(DFER)的自监督掩码自编码器框架,通过大规模未标注面部视频预训练一种高效且具备局部-全局交互能力的 Transformer(LGI-Former)编码器。该方法通过联合重建外观特征与建模时间上的面部运动,显著提升性能,在多个基准测试中实现 SOTA 结果,且推理 FLOPs 比 VideoMAE 减少约 38%。
Dynamic facial expression recognition (DFER) is essential to the development of intelligent and empathetic machines. Prior efforts in this field mainly fall into supervised learning paradigm, which is severely restricted by the limited labeled data in existing datasets. Inspired by recent unprecedented success of masked autoencoders (e.g., VideoMAE), this paper proposes MAE-DFER, a novel self-supervised method which leverages large-scale self-supervised pre-training on abundant unlabeled data to largely advance the development of DFER. Since the vanilla Vision Transformer (ViT) employed in VideoMAE requires substantial computation during fine-tuning, MAE-DFER develops an efficient local-global interaction Transformer (LGI-Former) as the encoder. Moreover, in addition to the standalone appearance content reconstruction in VideoMAE, MAE-DFER also introduces explicit temporal facial motion modeling to encourage LGI-Former to excavate both static appearance and dynamic motion information. Extensive experiments on six datasets show that MAE-DFER consistently outperforms state-of-the-art supervised methods by significant margins (e.g., +6.30\% UAR on DFEW and +8.34\% UAR on MAFW), verifying that it can learn powerful dynamic facial representations via large-scale self-supervised pre-training. Besides, it has comparable or even better performance than VideoMAE, while largely reducing the computational cost (about 38\% FLOPs). We believe MAE-DFER has paved a new way for the advancement of DFER and can inspire more relevant research in this field and even other related tasks. Codes and models are publicly available at https://github.com/sunlicai/MAE-DFER.
研究动机与目标
- 通过利用大规模未标注面部视频数据,缓解监督式 DFER 中的数据稀缺问题。
- 克服原始 Vision Transformer 在 DFER 微调阶段计算成本过高的问题。
- 通过显式建模时间面部运动,提升表征学习能力,而不仅依赖外观重建。
- 为 DFER 特定的预训练开发一种比 VideoMAE 更高效、更有效的替代方案。
- 在极少监督条件下,实现在真实场景与受控实验室数据集上的强性能表现。
提出的方法
- 提出一种高效的局部-全局交互 Transformer(LGI-Former),以降低 ViT 中全局自注意力机制带来的二次方 FLOP 开销。
- 采用高掩码率(75–90%)的掩码自编码目标,以重建视觉外观特征与时间运动特征。
- 通过重建帧间差分图,显式建模时间面部运动,增强动态表征学习能力。
- 采用双流重建头,从掩码视频 token 中联合重建外观内容与运动模式。
- 在下游 DFER 数据集微调前,使用大规模未标注面部视频数据(如 VoxCeleb2)对模型进行预训练。
- 采用对称的编码器-解码器架构,并使用轻量化解码器,以高效重建被掩码的视频块。
实验结果
研究问题
- RQ1与监督方法相比,基于大规模未标注面部视频的自监督预训练是否能显著提升 DFER 性能?
- RQ2在预训练阶段显式建模时间面部运动,是否能比仅依赖外观重建获得更优的动态表情表征?
- RQ3更高效的 Transformer 架构是否能在保持或提升性能的同时,降低微调阶段的计算成本,优于 VideoMAE?
- RQ4MAE-DFER 在涵盖真实场景与受控实验环境的多样化 DFER 数据集上是否具备良好的泛化能力?
- RQ5与监督方法及自监督基线相比,MAE-DFER 学习到的表征空间在类间可分性与紧凑性方面提升程度如何?
主要发现
- 在 DFEW 上,MAE-DFER 相较于最佳监督方法实现 +6.30% 的 UAR 提升,在 MAFW 上实现 +8.34% 的 UAR 提升,展现出强大的泛化能力。
- 在 DFEW 上,MAE-DFER 达到 82.45% 的 UAR 与 80.12% 的 WAR,相较于最佳监督方法在 CREMA-D 上的 UAR 提升超过 12%。
- 在所有数据集上,MAE-DFER 的推理 FLOPs 相较于 VideoMAE 减少约 38%,同时保持或超越其性能表现。
- t-SNE 可视化结果表明,与监督方法及 VideoMAE 基线相比,MAE-DFER 学习到的面部表情嵌入更具紧凑性与可分性。
- 在三个真实场景数据集(DFEW、FERV39k、MAFW)上,MAE-DFER 达到 SOTA 性能,并在 CREMA-D 与 RAVDESS 上超越了多模态方法。
- 重建结果表明,即使在高掩码率(75–90%)下,MAE-DFER 仍能有效恢复面部表情与运动模式,体现出强大的时空推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。