[论文解读] Dive into Ambiguity: Latent Distribution Mining and Pairwise Uncertainty Estimation for Facial Expression Recognition
本文提出 DMUE,一种新颖的端到端面部表情识别框架,通过潜在分布挖掘和成对不确定性估计解决标注模糊性问题。通过动态学习标签分布并利用实例间关系估计样本级不确定性,DMUE 在无需推理开销的情况下实现了最先进性能——在 RAF-DB 上达到 89.42%,在 AffectNet 上达到 63.11%。
Due to the subjective annotation and the inherent interclass similarity of facial expressions, one of key challenges in Facial Expression Recognition (FER) is the annotation ambiguity. In this paper, we proposes a solution, named DMUE, to address the problem of annotation ambiguity from two perspectives: the latent Distribution Mining and the pairwise Uncertainty Estimation. For the former, an auxiliary multi-branch learning framework is introduced to better mine and describe the latent distribution in the label space. For the latter, the pairwise relationship of semantic feature between instances are fully exploited to estimate the ambiguity extent in the instance space. The proposed method is independent to the backbone architectures, and brings no extra burden for inference. The experiments are conducted on the popular real-world benchmarks and the synthetic noisy datasets. Either way, the proposed DMUE stably achieves leading performance.
研究动机与目标
- 解决由于主观标注和类别间相似性导致的面部表情识别中长期存在的标注模糊性挑战。
- 通过挖掘更能反映模糊视觉特征的潜在标签分布,提升模型鲁棒性。
- 利用样本间的成对语义关系,在实例层面估计不确定性。
- 在不增加推理成本的前提下,实现对挖掘出的分布与原始标注之间训练焦点的动态调整。
- 在真实世界和合成噪声基准上实现最先进性能。
提出的方法
- 引入辅助多分支学习框架,在标签空间中迭代挖掘并优化潜在标签分布。
- 采用成对不确定性估计模块,利用样本间的语义特征关系来量化模糊性。
- 通过特征向量与类别中心之间的角度统计量计算置信度分数,以估计不确定性。
- 根据估计的不确定性动态调整训练损失,基于原始标注和挖掘出的分布进行加权。
- 设计框架为主干网络无关,并在推理阶段移除所有辅助组件,确保无额外计算开销。
- 应用来自人类标注者的归一化投票机制,以验证挖掘出的分布与人类感知的一致性。

实验结果
研究问题
- RQ1如何在端到端可训练的前提下,从模糊的面部表情数据中有效挖掘潜在标签分布?
- RQ2样本间的成对关系在多大程度上能提升面部表情识别中的不确定性估计?
- RQ3基于实例间关系的不确定性估计能否增强模型在模糊和噪声数据上的泛化能力?
- RQ4所提出方法在处理真实世界和合成噪声数据集方面与现有方法相比表现如何?
- RQ5该框架在不同数据分布和批量设置下是否保持性能的稳定性和一致性?
主要发现
- DMUE 在 RAF-DB 基准上实现了 89.42% 的新最先进准确率,优于先前方法。
- 在 AffectNet 数据集上,DMUE 达到 63.11% 的准确率,创下该基准的新纪录。
- 通过 50 名参与者的用户研究,验证了挖掘出的潜在分布与人类主观感知高度一致,表现为归一化投票分布的一致性。
- 不确定性估计模块在不同批次中产生一致的置信度分数,表现为对相同标签锚定图像的预测稳定。
- 该框架有效抑制了模糊样本的负面影响,提升了模型鲁棒性,且未增加推理成本。
- 可视化结果证实,较低的不确定性分数对应于人类志愿者判断为更模糊的图像。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。