[论文解读] Revisiting Self-Supervised Contrastive Learning for Facial Expression Recognition
本文提出了一种用于面部表情识别的自监督对比学习框架,通过引入有效的数据增强、困难负样本对采样以及基于掩码策略的假负样本消除(MaskFN),提升了表达特异性表征学习。该方法在分类和维度化的FER基准上均取得了最先进性能,优于现有的自监督方法。
The success of most advanced facial expression recognition works relies heavily on large-scale annotated datasets. However, it poses great challenges in acquiring clean and consistent annotations for facial expression datasets. On the other hand, self-supervised contrastive learning has gained great popularity due to its simple yet effective instance discrimination training strategy, which can potentially circumvent the annotation issue. Nevertheless, there remain inherent disadvantages of instance-level discrimination, which are even more challenging when faced with complicated facial representations. In this paper, we revisit the use of self-supervised contrastive learning and explore three core strategies to enforce expression-specific representations and to minimize the interference from other facial attributes, such as identity and face styling. Experimental results show that our proposed method outperforms the current state-of-the-art self-supervised learning methods, in terms of both categorical and dimensional facial expression recognition tasks.
研究动机与目标
- 为解决自监督对比学习中身份和风格特征作为捷径学习信号干扰表达特异性表征学习的挑战。
- 最小化面部身份、发型和化妆等非表达属性在自监督表征学习中的干扰。
- 在不依赖大规模标注数据集的前提下,提升分类表情识别与维度化愉悦-唤醒回归任务的性能。
- 开发策略以强制学习解耦的、与情绪相关的特征,同时减少对比学习中的虚假相关性。
提出的方法
- 提出一种新颖的数据增强策略,对正样本对应用时间相关增强(TimeAug),以提升时间一致性与表达敏感性。
- 采用一种困难负样本对采样方法,优先选择情绪标签不同但外观相似的样本对,增加区分难度,促进特征泛化。
- 提出一种假负样本消除机制(MaskFN),通过掩码面部区域(眼睛和嘴巴)防止模型将假正样本误判为负样本,从而减少假负样本对。
- 使用掩码特征提取模块,在对比预训练过程中隔离并强调与表达相关的关键区域(眼睛和嘴巴)。
- 在下游任务(FER和人脸识别)中应用线性探测和基于KNN的评估,以衡量表征质量和解耦程度。
- 采用延长训练周期(最多250个周期)并监控人脸识别性能下降情况,以验证身份信息去除目标。
实验结果
研究问题
- RQ1有效的数据增强是否能提升自监督对比学习在FER中的表达特异性表征学习?
- RQ2增加困难负样本对的数量是否能增强模型区分不同情绪表达的能力?
- RQ3能否通过有针对性的掩码策略减少假负样本对,从而提升下游FER性能?
- RQ4通过MaskFN去除身份相关信息在多大程度上提升了表达表征的泛化能力?
主要发现
- 在FER-2013数据集上,使用线性探测方法,该方法取得了59.5%的F1分数,比之前最先进自监督方法高出2.6个百分点。
- 在150个周期的预训练后,模型在LFW人脸识别基准上达到65.4%的Top-1准确率,表明身份相关特征被有效抑制。
- 在增加一个假负样本时,MaskFN策略使FER性能提升0.5%,验证了其在减少假负样本对方面的有效性。
- 在愉悦-唤醒回归任务(CCC和RMSE)上,MaskFN导致性能略有下降,表明分类与维度化表达学习之间存在权衡。
- 过度训练导致人脸识别性能下降,证实了在长期训练中模型会学习到身份信息,这与抑制此类特征的目标一致。
- 仅使用眼-嘴区域的描述符在FER上表现优于全脸特征(F1为59.1%),但在人脸识别任务上表现较差(KNN准确率为45.5%),证实高情绪内容的面部区域在表达学习中更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。