Skip to main content
QUICK REVIEW

[论文解读] Rethinking the Learning Paradigm for Facial Expression Recognition

Weijie Wang, Li, Bo|arXiv (Cornell University)|Sep 30, 2022
Emotion and Mood Recognition被引用 5
一句话总结

该论文提出了一种弱监督部分标签学习(Partial Label Learning, PLL)范式用于面部表情识别(FER),以应对主观众包标注带来的模糊性问题。通过使用掩码图像建模(Masked Image Modeling, MIM)进行自监督特征表示学习,并采用Transformer解码器查询标签置信度,该方法在RAF-DB、FERPlus和AffectNet数据集上实现了最先进性能,相比完全监督的SOTA方法准确率最高提升1.16%。

ABSTRACT

Due to the subjective crowdsourcing annotations and the inherent inter-class similarity of facial expressions, the real-world Facial Expression Recognition (FER) datasets usually exhibit ambiguous annotation. To simplify the learning paradigm, most previous methods convert ambiguous annotation results into precise one-hot annotations and train FER models in an end-to-end supervised manner. In this paper, we rethink the existing training paradigm and propose that it is better to use weakly supervised strategies to train FER models with original ambiguous annotation.

研究动机与目标

  • 解决由于主观众包标注和类别间相似性导致的真实世界面部表情数据集中固有的模糊性问题。
  • 挑战将模糊标注转换为独热编码标签的常见做法,因为后者会引入人为噪声。
  • 提出一种新颖的弱监督学习范式,利用部分标签学习(PLL)以保留原始模糊标注。
  • 通过利用自监督掩码图像建模(MIM)预训练提升在标签模糊情况下的表征学习能力。
  • 设计一种基于查询的标签消歧机制,利用Transformer解码器估计模糊标签候选的置信度。

提出的方法

  • 将FER建模为部分标签学习(PLL)问题,其中每个样本关联一组候选标签,其中仅一个为正确标签。
  • 在ImageNet-1K和FER特定数据上使用掩码图像建模(MIM)对视觉Transformer主干网络进行预训练,以学习鲁棒的自监督面部表情表征。
  • 在Transformer解码器中使用可学习的类别嵌入作为查询,通过与图像特征的交叉注意力计算每个候选标签的注意力置信度分数。
  • 引入标签均匀嵌入正则化损失($\mathcal{L}_{uniform}$),通过将查询嵌入在超球面上均匀分布来缓解类别不平衡问题。
  • 应用修订置信度模块,通过评估消歧决策的可靠性来优化标签预测。
  • 在PLL设置下端到端微调整个模型,以预测标签置信度的交叉熵损失为目标进行优化。

实验结果

研究问题

  • RQ1在FER训练中保留模糊标注是否能比转换为独热编码标签获得更好的性能?
  • RQ2在标签模糊的情况下,掩码图像建模(MIM)在学习鲁棒面部表情表征方面有多有效?
  • RQ3基于Transformer解码器的标签置信度查询机制是否能提升PLL在FER中的标签消歧性能?
  • RQ4所提出的PLL框架是否在真实世界FER基准上优于完全监督的最先进方法?
  • RQ5辅助模块如标签均匀正则化和修订置信度模块对消歧性能的贡献如何?

主要发现

  • 所提出的基于PLL的方法在RAF-DB上达到92.05%的准确率,优于先前SOTA方法(DMUE)的0.91%。
  • 在FERPlus上,该方法在MIM预训练和PLL设置下准确率相比SOTA提升1.16%,达到90.35%。
  • 在AffectNet上,该方法达到67.11%的准确率,相比使用相同主干网络的基线模型提升0.55%。
  • 消融实验表明,Transformer解码器模块在RAF-DB上贡献0.94%的准确率增益,在AffectNet7上贡献0.55%。
  • 在MIM预训练中使用HOG描述符而非像素级预测可获得更优性能(90.35% vs. 90.09%),表明HOG更适合FER任务。
  • MIM预训练与PLL的结合相比SL预训练带来0.72%的准确率增益,证明了在标签模糊条件下自监督学习的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。