Skip to main content
QUICK REVIEW

[论文解读] Learning to see people like people

Amanda Song, Linjie Li|arXiv (Cornell University)|May 5, 2017
Evolutionary Psychology and Human Behavior参考文献 14被引用 5
一句话总结

本文提出一种深度学习方法,通过利用10K名美国成人面部数据库上的预训练神经网络,预测人类对人脸特征(如可信度、吸引力和友好度)的主观判断。结果表明,使用VGG-16网络的conv5_2层经过主成分分析(PCA)处理后的特征,结合监督岭回归模型,在预测结果与平均人类评分的相关性上,优于人类之间的相互一致性,尤其在共识度较高的特征上表现更优。

ABSTRACT

Humans make complex inferences on faces, ranging from objective properties (gender, ethnicity, expression, age, identity, etc) to subjective judgments (facial attractiveness, trustworthiness, sociability, friendliness, etc). While the objective aspects of face perception have been extensively studied, relatively fewer computational models have been developed for the social impressions of faces. Bridging this gap, we develop a method to predict human impressions of faces in 40 subjective social dimensions, using deep representations from state-of-the-art neural networks. We find that model performance grows as the human consensus on a face trait increases, and that model predictions outperform human groups in correlation with human averages. This illustrates the learnability of subjective social perception of faces, especially when there is high human consensus. Our system can be used to decide which photographs from a personal collection will make the best impression. The results are significant for the field of social robotics, demonstrating that robots can learn the subjective judgments defining the underlying fabric of human interaction.

研究动机与目标

  • 建模并预测人脸的主观社会感知,如可信度、吸引力和友好度,这些特征在人际互动中至关重要,但在计算机视觉领域仍研究不足。
  • 探究在物体和人脸识别任务上预训练的深度神经网络表征是否能泛化到捕捉细微且具有共识的人类对人脸特征的判断。
  • 评估人类在40个人脸属性上的社会感知一致性,并确定机器学习模型在学习此类主观、群体评分数据方面的表现。
  • 可视化并解释驱动特定社会特征预测的神经网络内部表征,提升模型的可解释性。
  • 建立一个基于深度学习预测类人人脸社会判断的基准,应用于社交机器人和偏见检测。

提出的方法

  • 使用10K名美国成人面部数据库,微调六种最先进的预训练卷积神经网络(如VGG-16、ResNet)以预测社会感知。
  • 从VGG-16的conv5_2层提取特征,对特征进行主成分分析(PCA)降维,并使用监督岭回归模型预测人类评分。
  • 通过预测评分与40个人脸属性的平均人类评分之间的皮尔逊相关系数,评估模型性能。
  • 通过将评分者反复随机划分为两组并计算组间评分相关性,评估人类共识,从而建立人类一致性的基线。
  • 利用基于梯度的优化方法可视化显著的面部特征,以最大化特定神经元的激活,识别驱动每种特征感知的图像模式。
  • 在相同评估协议下,将模型性能与人类评分者间的一致性进行对比,确保公平比较。

实验结果

研究问题

  • RQ1在物体和人脸识别任务上预训练的深度神经网络表征是否能泛化到预测人脸特征的主观人类判断?
  • RQ2人类对某个人脸特征的共识程度如何影响机器学习模型对该特征的预测性能?
  • RQ3机器模型在主观人脸判断上与平均人类评分的相关性,能在多大程度上优于人类之间的相互一致性?
  • RQ4神经网络为不同社会特征(如可信度或吸引力)学习到的视觉模式或面部特征是什么?
  • RQ5生成式可视化技术能否揭示支撑人类对人脸社会感知的可解释、高层级面部线索?

主要发现

  • 在全部40个人脸属性上,模型与平均人类评分的相关性均高于人类之间的相互一致性,表明其在预测主观感知方面具有更高的稳定性。
  • 模型性能与人类共识程度强相关:共识度越高(如可信度、吸引力)的特征,其模型预测准确率也越高。
  • VGG-16的conv5_2层结合PCA与岭回归的组合表现最佳,对人脸吸引力的预测与人类评分的相关性达到0.75。
  • 模型相关性最高的特征为“快乐”(0.82),这与情绪表达如快乐更容易被一致感知且更易建模的事实相符。
  • “外向”(人类共识0.74)与“内向”(0.50)等特征表现出显著的不对称性,表明二者并非简单的对立面,对社会心理学中的既有假设构成挑战。
  • 对优化输入的可视化显示,模型重点关注关键面部区域——眼睛、鼻子、面颊和面部轮廓,这与人类进行社会判断时的感知线索一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。