Skip to main content
QUICK REVIEW

[论文解读] POSTER: A Pyramid Cross-Fusion Transformer Network for Facial Expression Recognition

Ce Zheng, Matías Mendieta|arXiv (Cornell University)|Apr 8, 2022
Emotion and Mood Recognition被引用 8
一句话总结

本文提出 POSTER,一种基于双流金字塔交叉融合Transformer的网络,通过基于Transformer的交叉融合机制,联合利用面部关键点与图像特征,以解决面部表情识别中的类间相似性、类内差异性和尺度敏感性问题。该方法在 RAF-DB 上达到 92.05% 的准确率,在 AffectNet 7 类上达到 67.31% 的准确率,通过注意力引导的特征交互和多尺度特征金字塔,显著提升了模型鲁棒性。

ABSTRACT

Facial expression recognition (FER) is an important task in computer vision, having practical applications in areas such as human-computer interaction, education, healthcare, and online monitoring. In this challenging FER task, there are three key issues especially prevalent: inter-class similarity, intra-class discrepancy, and scale sensitivity. While existing works typically address some of these issues, none have fully addressed all three challenges in a unified framework. In this paper, we propose a two-stream Pyramid crOss-fuSion TransformER network (POSTER), that aims to holistically solve all three issues. Specifically, we design a transformer-based cross-fusion method that enables effective collaboration of facial landmark features and image features to maximize proper attention to salient facial regions. Furthermore, POSTER employs a pyramid structure to promote scale invariance. Extensive experimental results demonstrate that our POSTER achieves new state-of-the-art results on RAF-DB (92.05%), FERPlus (91.62%), as well as AffectNet 7 class (67.31%) and 8 class (63.34%). The code is available at https://github.com/zczcwh/POSTER.

研究动机与目标

  • 解决面部表情识别中的三大核心挑战:类间相似性、类内差异性和尺度敏感性。
  • 在单一深度学习框架中统一处理上述挑战,而现有方法尚未完全实现此目标。
  • 利用面部关键点作为稀疏、显著区域引导,提升对细微表情线索的注意力。
  • 集成特征金字塔结构,增强模型对不同图像分辨率的尺度不变性。
  • 设计一种交叉融合Transformer机制,实现在图像与关键点特征之间的全局、双向注意力。

提出的方法

  • POSTER采用双流架构,图像流使用 ResNet-50 作为主干网络,关键点流使用 MobileFaceNet 提取特征。
  • 提出一种新型交叉融合Transformer模块,其中一个流的查询(Query)关注另一流的键(Key)和值(Value),实现双向特征交互。
  • 交叉融合机制同时利用图像与关键点特征的 Q、K、V 投影,其中 Q 来自一个流,K、V 来自另一流,以实现全局相关性建模与上下文感知的特征优化。
  • 网络引入特征金字塔结构,用于提取多尺度特征,增强对输入图像尺度变化的鲁棒性。
  • 最终分类头使用融合后的表示特征,整个网络在标准 FER 基准数据集上端到端训练。
  • 实现三种变体——POSTER-T、POSTER-S 和 POSTER,分别包含 4、6 和 8 个交叉融合模块,以在性能与效率之间取得平衡。

实验结果

研究问题

  • RQ1统一的深度学习框架能否有效解决面部表情识别中的类间相似性、类内差异性和尺度敏感性问题?
  • RQ2图像与关键点特征之间的交叉注意力机制在多大程度上提升了模型对细微表情差异的鲁棒性?
  • RQ3特征金字塔的引入在多大程度上改善了 FER 模型的尺度不变性?
  • RQ4所提出的交叉融合Transformer机制是否优于关键点与图像特征的简单拼接或早期融合方法?
  • RQ5当交叉融合Transformer模块数量变化时,模型复杂度与性能之间的权衡关系如何?

主要发现

  • POSTER 在 RAF-DB 数据集上达到 92.05% 的新 SOTA 准确率,超越此前所有方法。
  • 在 AffectNet 7 类设置下,POSTER 达到 67.31% 的准确率,显著优于先前 SOTA 方法。
  • 混淆矩阵显示,POSTER 降低了各类表情的误分类率,并提升了所有表情类别在对角线上的准确率,表明类内差异性显著减少。
  • 当查询(Q)来自图像流、键(K)和值(V)来自关键点流时,交叉融合机制表现最佳,证实了注意力方向的重要性。
  • 尽管 POSTER-T 参数量较少(52.2M),且与 DMUE 的 FLOPs 相当,但在 RAF-DB 上仍领先 2.55%,在 AffectNet 上领先 4.19%。
  • 包含 8 个交叉融合模块的完整 POSTER 模型达到最高准确率,表明在合理计算预算下,更深的融合结构可进一步提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。