[论文解读] Visual Saliency Maps Can Apply to Facial Expression Recognition
本论文提出了一种新颖的半监督方法,仅使用由预训练的一般性深度学习显著性模型生成的视觉显著性图,对七种情绪的面部表情进行分类。尽管在训练中未直接使用面部图像,该方法在CK+数据集上达到了63%的准确率,在FER-2013数据集上达到50%,远超1/7的随机猜测水平,且显著性图分类与图像分类结果之间具有很强的相关性(r > 0.8),表明人类可能通过注视面部不同区域来感知情绪。
Human eyes concentrate different facial regions during distinct cognitive activities. We study utilising facial visual saliency maps to classify different facial expressions into different emotions. Our results show that our novel method of merely using facial saliency maps can achieve a descent accuracy of 65\%, much higher than the chance level of $1/7$. Furthermore, our approach is of semi-supervision, i.e., our facial saliency maps are generated from a general saliency prediction algorithm that is not explicitly designed for face images. We also discovered that the classification accuracies of each emotional class using saliency maps demonstrate a strong positive correlation with the accuracies produced by face images. Our work implies that humans may look at different facial areas in order to perceive different emotions.
研究动机与目标
- 探究仅使用视觉显著性图是否能有效实现面部表情分类,而无需直接使用原始面部图像。
- 通过基于显著性的分类方法,探索人类眼动模式与情绪感知之间的关系。
- 评估一种利用预训练显著性模型的半监督方法在情绪识别中的性能。
- 确定基于显著性图的分类结果是否与传统基于图像的方法具有强相关性。
- 揭示人类可能通过关注面部不同区域来感知不同情绪的机制。
提出的方法
- 使用来自SALICON、MIT1003和CAT2000数据集的预训练深度学习显著性检测模型,为面部图像生成显著性图,且未针对人脸任务进行微调。
- 将显著性图作为全连接神经网络分类器的输入特征,该分类器用于识别七种面部情绪。
- 在FER-2013和CK+数据集上进行训练,学习率分别为0.01和250/60个周期,CK+数据集采用10折交叉验证。
- 通过公共和私有测试集上的准确率和混淆矩阵,评估分类性能。
- 计算显著性图分类与原始图像分类结果之间对角线准确率值的皮尔逊相关系数。
- 该方法为半监督学习,因为显著性模型未在面部表情数据上显式训练,而是在多样化图像类别上进行训练。
实验结果
研究问题
- RQ1能否仅使用通用显著性预测模型生成的显著性图,有效实现面部表情识别?
- RQ2基于显著性图的分类准确率与基于原始面部图像的分类准确率之间是否存在强相关性?
- RQ3不同情绪表达是否引发具有差异性的显著性模式,且与人类眼动行为相对应?
- RQ4显著性图能否作为理解人类情绪感知机制的代理?
- RQ5基于显著性图的分类性能是否在不同情绪类别间存在差异?若存在,原因是什么?
主要发现
- 所提方法在FER-2013私有测试集上达到50%的准确率,在CK+数据集上达到63%,均显著高于约14.3%的1/7随机猜测水平。
- 在FER-2013私有测试集上,基于显著性图的分类结果与基于图像的分类结果之间表现出极强的正相关性(r = 0.9450)。
- 在FER-2013公共测试集上,显著性与图像分类准确率的皮尔逊相关系数为0.9277;在CK+上为0.8080,表明分类性能高度一致。
- 混淆矩阵显示,使用显著性图时,快乐和惊讶是最易区分的情绪,而轻蔑则识别效果较差,可能因其在视觉注意力模式上与厌恶和快乐相似。
- 结果表明,人类可能通过聚焦于面部不同区域来感知不同情绪,这一推论得到显著性模式与情绪感知之间对齐关系的支持。
- 本研究证明,即使未直接使用面部图像数据,显著性图仍可作为情绪识别的有效且可解释的表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。