Skip to main content
QUICK REVIEW

[论文解读] Guiding human gaze with convolutional neural networks

Leon A. Gatys, Matthias Kümmerer|arXiv (Cornell University)|Dec 18, 2017
Gaze Tracking and Assistive Technology参考文献 1被引用 13
一句话总结

本文提出了一种基于深度学习的方法,利用卷积神经网络(CNN)对图像进行处理,使人类注视被引导至特定区域,其依据是目标注视分布。通过使用基于感知的损失函数训练CNN,模型在人类眼动追踪实验验证下,平均使目标物体的注视概率提高43%,同时保持了图像的自然性。

ABSTRACT

The eye fixation patterns of human observers are a fundamental indicator of the aspects of an image to which humans attend. Thus, manipulating fixation patterns to guide human attention is an exciting challenge in digital image processing. Here, we present a new model for manipulating images to change the distribution of human fixations in a controlled fashion. We use the state-of-the-art model for fixation prediction to train a convolutional neural network to transform images so that they satisfy a given fixation distribution. For network training, we carefully design a loss function to achieve a perceptual effect while preserving naturalness of the transformed images. Finally, we evaluate the success of our model by measuring human fixations for a set of manipulated images. On our test images we can in-/decrease the probability to fixate on selected objects on average by 43/22% but show that the effectiveness of the model depends on the semantic content of the manipulated images.

研究动机与目标

  • 开发一种数据驱动的方法,通过操纵视觉显著性来控制图像中的人类注视。
  • 解决在显著性图与图像之间映射高度模糊的背景下,生成能诱导特定注视模式且外观自然的图像的挑战。
  • 通过在多样化数据集上训练固定CNN架构,减少注视预测模型对对抗样本的过拟合。
  • 通过测量实际注视模式的人类行为实验验证该方法的有效性。

提出的方法

  • 训练一个基于CNN的图像变换网络,将输入图像映射为与指定目标注视分布匹配的新图像。
  • 损失函数结合了基于预训练注视预测CNN(DeepGaze II)特征的感知损失和内容保持损失,以维持图像自然性。
  • 目标注视分布被定义为空间显著性图,通过模糊对象掩码以避免锐利过渡,提升泛化能力。
  • 在大规模图像及其对应显著性图数据集上训练模型,使用反向传播优化图像变换。
  • 通过人类眼动追踪实验评估图像操纵效果,记录受控条件下被试的注视模式。
  • 分析多个数据子集(例如,第一组、仅第一注视)以评估对记忆效应和有意识控制的鲁棒性。

实验结果

研究问题

  • RQ1能否训练一个深度神经网络,使人类观察者系统性地将注视集中于特定目标区域?
  • RQ2与原始图像相比,该模型在提高目标物体注视概率方面的有效性如何?
  • RQ3该模型在变换过程中在多大程度上保持了图像的自然性和身份特征?
  • RQ4人类注视模式如何响应被操纵的图像?该效应在不同实验条件下是否具有鲁棒性?

主要发现

  • 该模型在测试图像上成功将目标物体的平均注视概率提高43%,在抑制注视时降低22%。
  • 在仅第一注视的情况下,目标物体的注视概率平均提高达3230%,表明具有强大的初始注意力引导能力。
  • 对于第一注视,目标物体吸引的注视概率中位数相对增加57%,抑制时为48%,表明对自主控制具有鲁棒性。
  • 该方法的有效性取决于图像的语义内容,对具有清晰、明确物体的图像成功率更高。
  • 人类对被操纵图像的注视模式与目标显著性图高度匹配,验证了模型的预测能力。
  • 模型对记忆效应和有意识控制保持鲁棒,表现为在第一组和仅第一注视分析中结果一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。