Skip to main content
QUICK REVIEW

[论文解读] Human perception in computer vision

Ron Dekel|arXiv (Cornell University)|Jan 17, 2017
Visual Attention and Saliency Detection参考文献 47被引用 4
一句话总结

本文通过将DNN激活变化与心理物理学测量的感知敏感度进行比较,研究了在ImageNet上训练的深度神经网络(DNNs)是否表现出人类视觉感知的计算相关性。研究发现,中层DNN层与对图像变化的敏感度相关,而深层则与分割、拥挤效应和形状感知相关,表明尽管架构不同,通用视觉计算在DNNs与人类中可能收敛于相似的最优解。

ABSTRACT

Computer vision has made remarkable progress in recent years. Deep neural network (DNN) models optimized to identify objects in images exhibit unprecedented task-trained accuracy and, remarkably, some generalization ability: new visual problems can now be solved more easily based on previous learning. Biological vision (learned in life and through evolution) is also accurate and general-purpose. Is it possible that these different learning regimes converge to similar problem-dependent optimal computations? We therefore asked whether the human system-level computation of visual perception has DNN correlates and considered several anecdotal test cases. We found that perceptual sensitivity to image changes has DNN mid-computation correlates, while sensitivity to segmentation, crowding and shape has DNN end-computation correlates. Our results quantify the applicability of using DNN computation to estimate perceptual loss, and are consistent with the fascinating theoretical view that properties of human perception are a consequence of architecture-independent visual learning.

研究动机与目标

  • 研究在ImageNet上训练的深度神经网络(DNNs)中的计算过程是否与人类视觉感知相关。
  • 确定DNN处理过程中,对图像变化、分割、拥挤和形状的感知敏感度在哪个阶段最显著地体现。
  • 评估DNN表征是否可作为人类心理物理学反应的预测模型,且不受任务难度或分类一致性的影响。
  • 评估DNN作为建模脑功能和设计图像处理中感知损失度量工具的潜力。

提出的方法

  • 本研究使用受控的心理物理学数据集(局部图像掩蔽数据库),包含1,080张图像和不同噪声扰动,以测量人类对图像变化的感知敏感度。
  • 利用在ImageNet上训练的DNN(如AlexNet、VGG)通过平均绝对激活差异和互信息计算各层的表征变化。
  • 将感知敏感度与各层DNN激活变化进行定量比较,以识别最能预测人类感知的层。
  • 分析聚焦于图像变化显著性、格式塔效应(分割、拥挤、形状)以及对比度恒定性等感知现象。
  • 通过使用简化且非自然的刺激,确保各类别间固有难度一致,从而将感知效应与任务特异性混淆因素分离。
  • 将基于DNN的感知度量与简单图像统计量及详细的心理物理学模型进行比较,以评估其预测能力。

实验结果

研究问题

  • RQ1不同层次的深度神经网络计算是否与人类对图像变化的感知敏感度相关?
  • RQ2哪些DNN层最能预测人类对复杂视觉现象(如分割、拥挤和形状)的感知?
  • RQ3DNN表征在多大程度上反映了对比度恒定性和带通滤波等感知机制?
  • RQ4DNN表征能否作为准确且通用的人类视觉感知模型,且不受任务特异性偏见的影响?
  • RQ5DNN在估计感知损失方面的预测能力与传统图像统计量和详细感知模型相比如何?

主要发现

  • 对图像变化的感知敏感度与中层DNN层的激活变化存在强烈相关性,表明这些层捕捉了上下文相关的显著性。
  • 对格式塔现象(分割、拥挤、形状)的敏感度与深层DNN计算的相关性最强,表明网络末端的表征反映了系统级的感知处理。
  • 对比度恒定性(早期层中的带通滤波,随后在深层中进行校正)在DNN计算中得到体现,与人类视觉转导过程一致。
  • 基于DNN的感知度量优于简单图像统计量,并与详细心理物理学模型在预测人类感知反应方面表现相当。
  • 结果支持理论观点:尽管架构不同,DNNs与生物系统中的通用视觉计算可能收敛于相似的最优解。
  • 与三维结构和对称性相关的感知效应在DNN中无显著对应,表明前馈DNN在建模某些高层感知现象方面存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。