[论文解读] What are the visual features underlying human versus machine vision?
本研究提出 Clicktionary,一种基于网络的互动游戏,通过让参与者协作选择图像中对物体识别至关重要的区域,以识别人类用于物体识别的诊断性视觉特征。尽管深度神经网络(DCNs)已达到人类水平的识别准确率,但本研究发现人类提取的重要性图与DCN特征相关性较弱,表明人类与机器视觉在视觉策略上存在根本性差异。
Although Deep Convolutional Networks (DCNs) are approaching the accuracy of human observers at object recognition, it is unknown whether they leverage similar visual representations to achieve this performance. To address this, we introduce Clicktionary, a web-based game for identifying visual features used by human observers during object recognition. Importance maps derived from the game are consistent across participants and uncorrelated with image saliency measures. These results suggest that Clicktionary identifies image regions that are meaningful and diagnostic for object recognition but different than those driving eye movements. Surprisingly, Clicktionary importance maps are only weakly correlated with relevance maps derived from DCNs trained for object recognition. Our study demonstrates that the narrowing gap between the object recognition accuracy of human observers and DCNs obscures distinct visual strategies used by each to achieve this performance.
研究动机与目标
- 识别人类用于物体识别的视觉特征,超越眼动追踪或显著性方法的局限。
- 填补理解深度卷积网络(DCNs)是否在性能相当的情况下使用与人类相似的视觉表征这一研究空白。
- 开发一种可扩展的协作方法,用于跨多样化物体类别推导人类生成的重要性图。
- 通过一种新颖的行为学基础方法,比较人类与DCNs的视觉策略。
- 探索人类标注的特征重要性图是否能够弥合生物视觉与人工视觉系统之间的差距。
提出的方法
- Clicktionary 是一种基于网络的游戏,其中一名玩家(教师)选择其认为对物体识别至关重要的图像区域,另一名玩家(学生)仅根据这些区域识别物体。
- 通过聚合数千对参与者的选择数据生成重要性图,像素强度反映其被选为诊断特征的频率。
- 该方法利用协作式人类感知识别诊断性视觉信息的‘热点区域’,与被动注意或显著性不同。
- 将重要性图与来自人类眼动追踪和计算模型(如 DeepGaze)的显著性图,以及使用 LRP 和基于梯度的敏感性分析生成的 DCN(VGG16)相关性图进行比较。
- 通过统计分析测量人类重要性图与人类显著性图及 DCN 相关性图在多个图像类别中的相关性。
- 人类识别的重要性图数据集已公开发布于 clickme.ai,以支持未来视觉模型的训练。
实验结果
研究问题
- RQ1人类观察者用于识别物体的视觉特征是什么?这些特征在个体之间是否具有一致性?
- RQ2人类生成的诊断特征与基于眼动追踪或计算模型生成的图像显著性图相比如何?
- RQ3深度卷积网络(DCNs)在物体识别过程中在多大程度上依赖与人类相同的视觉特征?
- RQ4即使双方均达到高物体识别准确率,人类与DCNs在视觉策略上是否存在系统性差异?
- RQ5人类标注的特征重要性图是否能提升机器视觉系统的性能或对齐程度?
主要发现
- Clicktionary 生成的重要性图在参与者间表现出强烈的模式一致性,表明诊断特征(如眼镜镜框)被一致识别。
- 人类重要性图与基于计算模型(如 DeepGaze)和人类眼动追踪数据生成的显著性图无显著相关性,表明其反映的是诊断性而非单纯显著性。
- 人类重要性图与 VGG16 的 LRP 相关性图之间的相关性较弱(r < 0.5),表明 DCNs 依赖的视觉特征与人类不同。
- 人类重要性图与基于梯度的敏感性图之间的相关性同样微弱,进一步证实 DCNs 与人类使用不同的视觉策略。
- 人类重要性图与显著性图之间的相关性至多为弱相关,确认诊断特征并非最显著的视觉元素。
- 本研究表明,DCNs 达到高物体识别准确率并不意味着其与人类共享视觉表征,揭示了其底层策略的根本性差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。