[论文解读] Learn From All: Erasing Attention Consistency for Noisy Label Facial Expression Recognition
本文提出了一种名为擦除注意力一致性(Erasing Attention Consistency, EAC)的新方法,通过在训练过程中强制执行翻转注意力一致性,抑制面部表情识别中对噪声标签的记忆化现象,防止模型过度关注与标签相关的特征。EAC在噪声和干净的FER基准上均实现了最先进性能,且无需噪声率估计或标签集成。
Noisy label Facial Expression Recognition (FER) is more challenging than traditional noisy label classification tasks due to the inter-class similarity and the annotation ambiguity. Recent works mainly tackle this problem by filtering out large-loss samples. In this paper, we explore dealing with noisy labels from a new feature-learning perspective. We find that FER models remember noisy samples by focusing on a part of the features that can be considered related to the noisy labels instead of learning from the whole features that lead to the latent truth. Inspired by that, we propose a novel Erasing Attention Consistency (EAC) method to suppress the noisy samples during the training process automatically. Specifically, we first utilize the flip semantic consistency of facial images to design an imbalanced framework. We then randomly erase input images and use flip attention consistency to prevent the model from focusing on a part of the features. EAC significantly outperforms state-of-the-art noisy label FER methods and generalizes well to other tasks with a large number of classes like CIFAR100 and Tiny-ImageNet. The code is available at https://github.com/zyh-uaiaaaa/Erasing-Attention-Consistency.
研究动机与目标
- 解决面部表情识别(FER)中噪声标签学习的挑战,其中类别间相似性以及标注模糊性导致模型泛化困难。
- 克服现有方法依赖基于损失的样本过滤或复杂标签集成的局限性,这些方法可能将困难样本误认为噪声样本,或带来高计算成本。
- 提出一种新的特征学习视角,通过干扰模型对与标签相关特征的关注,来抑制其对噪声标签的记忆化。
- 开发一种方法,使其在大规模多类别分类任务(如CIFAR100和Tiny-ImageNet)上具有良好泛化能力,且无需调整网络架构或超参数。
- 在无需事先知晓噪声率或训练多个模型的前提下实现鲁棒性能,提升在实际应用场景中的实用性。
提出的方法
- 设计一种不平衡训练框架,在训练过程中随机擦除输入图像的图像块,以促进整体特征学习。
- 通过要求模型对图像及其水平翻转版本生成相似的注意力图,强制执行翻转注意力一致性。
- 引入一致性损失,惩罚原始图像与翻转图像之间注意力图的差异,以促进鲁棒且可泛化的特征表示。
- 将翻转注意力一致性损失用作正则化项,通过阻止模型关注与错误标签相关的部分特征,来抑制对噪声标签的记忆化。
- 使用交叉熵损失与所提出的统一性损失相结合的方式端到端训练模型,其中一致性损失的权重 $λ$ 通过经验调优。
- 利用面部表情的固有对称性——即翻转保留语义内容但不保留标签——来隐式引导模型学习潜在的真实特征。
实验结果
研究问题
- RQ1在面部表情识别中,强制图像翻转之间的注意力一致性是否能减少对噪声标签的记忆化?
- RQ2一种避免基于损失的样本过滤的特征学习方法,是否在噪声标签FER任务中优于传统方法?
- RQ3一种为低类别FER设计的方法,是否能有效泛化到CIFAR100和Tiny-ImageNet等高类别分类任务?
- RQ4在干净和噪声数据集上,EAC在不同噪声率下与最先进方法相比表现如何?
- RQ5在噪声学习场景中,EAC在多大程度上减少了对噪声率估计或标签集成的依赖?
主要发现
- 在RAF-DB数据集上,EAC在噪声标签下达到89.99%的准确率,超过先前最先进方法(RUL为88.98%),并优于所有基线模型。
- 在AffectNet(7个类别)上,EAC在相同评估协议下达到65.32%的top-1准确率,超过先前最先进方法(KTN为63.97%)。
- 在FERPlus上,EAC达到89.64%的准确率,优于RUL(88.75%)和DMUE(88.64%),且无需使用标签集成。
- 在CIFAR100(30%噪声)上,EAC相比基线模型top-1准确率提升10.89个百分点;在Tiny-ImageNet(30%噪声)上,提升达22.19个百分点。
- EAC在不同数据集和噪声水平下均表现出良好泛化能力,性能提升稳定,且无需噪声率估计或多分支架构。
- 消融研究证实,一致性损失在 $λ$ 的广泛取值范围内均有效,且在RAF-DB数据集上30%噪声条件下,$λ = 5$ 时达到最优性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。