[论文解读] Occlusion-Adaptive Deep Network for Robust Facial Expression Recognition
本文提出了一种遮挡自适应深度网络(OADN),通过结合基于关键点引导的注意力分支以抑制被遮挡区域的受损特征,以及基于面部区域的分支以学习互补的、局部级别的分类器,从而在部分遮挡条件下提升面部表情识别性能。OADN在五个基准数据集上实现了最先进性能,包括在Pose-FERPlus数据集上达到88.52%的准确率,在Occlusion-FERPlus数据集上达到84.57%,显著优于先前方法如RAN。
Recognizing the expressions of partially occluded faces is a challenging computer vision problem. Previous expression recognition methods, either overlooked this issue or resolved it using extreme assumptions. Motivated by the fact that the human visual system is adept at ignoring the occlusion and focus on non-occluded facial areas, we propose a landmark-guided attention branch to find and discard corrupted features from occluded regions so that they are not used for recognition. An attention map is first generated to indicate if a specific facial part is occluded and guide our model to attend to non-occluded regions. To further improve robustness, we propose a facial region branch to partition the feature maps into non-overlapping facial blocks and task each block to predict the expression independently. This results in more diverse and discriminative features, enabling the expression recognition system to recover even though the face is partially occluded. Depending on the synergistic effects of the two branches, our occlusion-adaptive deep network significantly outperforms state-of-the-art methods on two challenging in-the-wild benchmark datasets and three real-world occluded expression datasets.
研究动机与目标
- 为解决在真实场景中常见但先前研究较少关注的部分遮挡背景下鲁棒面部表情识别的挑战。
- 通过聚焦非遮挡面部区域并舍弃被遮挡区域的受损特征,提升模型鲁棒性。
- 通过在非重叠的面部块上独立训练分类器,提升特征的多样性与判别能力。
- 通过来自基于区域分类器的多监督信号缓解小规模表情数据集中的过拟合问题。
- 构建一个统一的深度学习框架,协同结合注意力机制与基于区域的学习,实现对遮挡的鲁棒识别。
提出的方法
- 基于关键点引导的注意力分支利用检测到的面部关键点的置信度分数生成注意力图,以抑制被遮挡面部区域的特征。
- 注意力图用于调制全局特征,使网络在表示学习过程中聚焦于非遮挡的、具有判别性的面部区域。
- 面部区域分支将最终的卷积特征图划分为K个非重叠的块,每个块独立训练以预测面部表情。
- 网络联合优化两个损失:一个来自基于关键点引导的注意力分支,另一个来自面部区域分支,并使用可学习权重λ来平衡其贡献。
- 该方法利用关键面部特征(如眼睛、嘴巴)的领域知识引导注意力,确保聚焦于与表情相关的关键区域。
- 模型在FERPlus、RAF-DB及野外遮挡基准数据集上端到端训练,并通过消融实验验证各组件的贡献。
实验结果
研究问题
- RQ1深度学习模型如何在表情识别过程中有效抑制被面部遮挡污染的特征?
- RQ2由面部关键点引导的注意力机制在多大程度上能提升表情识别对遮挡的鲁棒性?
- RQ3在非重叠的面部区域上独立训练分类器是否能增强模型在部分遮挡下的鲁棒性?
- RQ4注意力机制与基于区域的学习之间的协同效应相比单分支方法,如何提升性能?
- RQ5哪些超参数设置(如置信度阈值T、区域数量K、损失权重λ)能在遮挡表情数据集上实现最佳性能?
主要发现
- OADN在Pose-FERPlus数据集上达到88.52%的准确率,相比RAN提升6.29个百分点。
- 在Occlusion-FERPlus数据集上,OADN取得84.57%的准确率,相比RAN在Pose>45子集上提升7.10个百分点。
- 消融实验表明,最优的关键点置信度阈值T为0.6,过高或过低的值均导致性能下降。
- 在面部区域分支中,K=4个区域时性能最佳,区域过少或过多均会降低准确率。
- 联合优化时λ=1(仅注意力分支)的性能劣于双分支联合训练,证实了两部分组件的互补优势。
- 可视化结果表明,与gACNN相比,OADN在大角度头部姿态和严重遮挡下泛化能力更强,即使gACNN失败,OADN仍能做出正确预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。