Skip to main content
QUICK REVIEW

[论文解读] Towards Semi-Supervised Deep Facial Expression Recognition with An Adaptive Confidence Margin

Hangyu Li, Nannan Wang|arXiv (Cornell University)|Mar 23, 2022
Emotion and Mood Recognition被引用 6
一句话总结

本文提出Ada-CM,一种新颖的半监督深度面部表情识别方法,通过自适应学习置信度边界,动态利用所有未标记数据——包括高置信度和低置信度样本——对高置信度样本应用伪标签,对低置信度样本则采用特征级对比学习目标。该方法在低标签设置下于RAF-DB、SFEW和AffectNet数据集上均达到最先进性能,超越完全监督基线模型。

ABSTRACT

Only parts of unlabeled data are selected to train models for most semi-supervised learning methods, whose confidence scores are usually higher than the pre-defined threshold (i.e., the confidence margin). We argue that the recognition performance should be further improved by making full use of all unlabeled data. In this paper, we learn an Adaptive Confidence Margin (Ada-CM) to fully leverage all unlabeled data for semi-supervised deep facial expression recognition. All unlabeled samples are partitioned into two subsets by comparing their confidence scores with the adaptively learned confidence margin at each training epoch: (1) subset I including samples whose confidence scores are no lower than the margin; (2) subset II including samples whose confidence scores are lower than the margin. For samples in subset I, we constrain their predictions to match pseudo labels. Meanwhile, samples in subset II participate in the feature-level contrastive objective to learn effective facial expression features. We extensively evaluate Ada-CM on four challenging datasets, showing that our method achieves state-of-the-art performance, especially surpassing fully-supervised baselines in a semi-supervised manner. Ablation study further proves the effectiveness of our method. The source code is available at https://github.com/hangyu94/Ada-CM.

研究动机与目标

  • 为解决半监督面部表情识别中固定阈值伪标签方法效率低下的问题,该方法可更充分地利用低置信度未标记样本。
  • 通过充分利用所有未标记数据(包括低置信度样本)来提升模型泛化能力。
  • 开发一种在训练过程中动态演化的自适应置信度边界,以反映不同面部表情类别识别难度的差异。
  • 通过在低置信度样本上引入对比学习目标,增强模型对类内差异的特征学习能力。
  • 在低数据设置下,通过提升半监督学习中的数据利用效率,超越完全监督基线模型。

提出的方法

  • 在训练过程中,基于模型对不同面部表情类别的预测置信度,动态学习自适应置信度边界。
  • 将所有未标记样本划分为两个子集:置信度分数 ≥ 自适应边界的样本(子集 I)和低于边界的样本(子集 II)。
  • 对子集 I,应用交叉熵损失,比较模型预测与从强增强视图生成的伪标签。
  • 对子集 II,采用基于InfoNCE损失的特征级对比学习目标,以提升特征的可分性和类内紧凑性。
  • 在训练的各轮次中,迭代更新置信度边界,以反映不同表情类别学习难度的变化。
  • 该方法端到端可训练,并在统一框架中整合了伪标签和对比学习。

实验结果

研究问题

  • RQ1与固定阈值方法相比,自适应置信度边界是否能提升半监督面部表情识别中未标记数据的利用效率?
  • RQ2通过对比学习目标引入低置信度未标记样本,对特征学习和模型性能有何影响?
  • RQ3当仅使用少量标签数据时,Ada-CM能否超越完全监督基线模型?
  • RQ4自适应边界机制是否能提升在识别难度各异的表情类别上的泛化能力?
  • RQ5在跨数据集评估中,尤其在标签数据稀缺时,该方法表现如何?

主要发现

  • 在低标签设置下(RAF-DB为1/3,SFEW为1/2,AffectNet为1/28的标签数据比例),Ada-CM在RAF-DB上超越完全监督基线0.29%,在SFEW上超越1.38%,在AffectNet上超越4.45%。
  • 使用4,000个标签样本和WideResNet-28-2骨干网络时,Ada-CM在RAF-DB上达到79.34%的准确率,比MarginMix高出13.28个百分点。
  • 在跨数据集CK+基准测试中使用ResNet-18骨干网络,Ada-CM在4,000个标签样本下达到85.32%的准确率,比完全监督基线高出3.6%。
  • 消融实验表明,自适应边界和对低置信度样本的对比学习目标对性能提升均至关重要。
  • t-SNE可视化显示,Ada-CM学习到更具判别性的特征,类间边界更清晰,类内聚类更紧密,尤其在难分类类别(如悲伤)中表现更优。
  • 该方法在不同数据集间泛化能力出色,即使使用轻量级ResNet-18骨干网络,性能也优于以往工作所采用的更重型模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。