Skip to main content
QUICK REVIEW

[论文解读] Connecting Gaze, Scene, and Attention: Generalized Attention Estimation via Joint Modeling of Gaze and Scene Saliency

Eunji Chong, Nataniel Ruiz|arXiv (Cornell University)|Jul 27, 2018
Gaze Tracking and Assistive Technology被引用 7
一句话总结

本文提出了一种多任务深度学习框架,联合建模注视方向(3D偏航角与俯仰角)和场景显著性,以实现在多样化自然场景下的泛化视觉注意力估计。通过联合训练三个数据集——GazeFollow、EYEDIAP 和 SynHead,该模型在注视-显著性预测任务上达到最先进性能,并在 MMDB 数据集上针对新型泛化注意力预测任务实现了 0.902 的平均精确率,有效区分了图像内与图像外的注视目标。

ABSTRACT

This paper addresses the challenging problem of estimating the general visual attention of people in images. Our proposed method is designed to work across multiple naturalistic social scenarios and provides a full picture of the subject's attention and gaze. In contrast, earlier works on gaze and attention estimation have focused on constrained problems in more specific contexts. In particular, our model explicitly represents the gaze direction and handles out-of-frame gaze targets. We leverage three different datasets using a multi-task learning approach. We evaluate our method on widely used benchmarks for single-tasks such as gaze angle estimation and attention-within-an-image, as well as on the new challenging task of generalized visual attention prediction. In addition, we have created extended annotations for the MMDB and GazeFollow datasets which are used in our experiments, which we will publicly release.

研究动机与目标

  • 解决在非受限、自然主义社交互动中泛化视觉注意力预测的挑战,其中注视可能指向图像框内或框外。
  • 开发一种统一模型,联合估计 3D 注视向量与注视可能性图,实现在多样化注视行为下的准确预测。
  • 改进以往仅关注图像内注视目标或受限场景(如基于屏幕的眼动追踪)的研究工作。
  • 为 MMDB 和 GazeFollow 数据集创建并发布扩展标注,以支持未来在泛化注意力建模方面的研究。
  • 评估多数据集、多任务学习在提升注视行为类型间鲁棒性与泛化能力方面的有效性。

提出的方法

  • 该模型采用双路径神经架构,其中场景路径用于显著性估计,人脸路径用于 3D 注视向量预测(偏航角与俯仰角)。
  • 采用多任务学习,联合优化注视角度估计(使用 EYEDIAP)、场景显著性(使用修改后的 GazeFollow)以及图像外注视检测(使用 SynHead)。
  • 通过结合显著性图与注视向量生成注视可能性图,模型显式抑制当注视超出画面时的激活。
  • 采用“投影并比较”损失函数以提升姿态泛化能力,但其影响有限,因训练数据中姿态覆盖范围受限。
  • 模型采用端到端训练,分别使用交叉熵损失和 L2 损失优化注视角度与显著性图预测。
  • 最终输出为密集的注视可能性热力图,反映图像内注意力与图像外注视,实现可解释的注意力估计。

实验结果

研究问题

  • RQ1统一的深度学习模型能否有效估计多样化自然主义注视行为(包括图像外注视)下的视觉注意力?
  • RQ2联合建模注视方向与场景显著性相较于单任务方法,如何提升泛化注意力预测的性能?
  • RQ3多数据集、多任务训练对注视与注意力估计的泛化性与鲁棒性有何影响?
  • RQ4现有数据集在多大程度上可被扩展以支持新型泛化视觉注意力预测任务?
  • RQ5架构设计选择与损失函数如何影响模型检测图像外注视目标的能力?

主要发现

  • 在使用 MMDB 数据集的新型泛化注意力预测任务中,该模型实现了 0.902 的最先进平均精确率,显著优于基线方法。
  • 在 GazeFollow 基准测试中,该模型实现了 0.896 的 AUC,表明其在图像内注视-显著性预测方面表现强劲。
  • 通过联合训练 EYEDIAP 与 SynHead 数据集,性能得到提升:在仅使用 GazeFollow 与 EYEDIAP 训练时,平均精确率为 0.820;在完整多数据集训练下,达到 0.902。
  • 定性结果表明,当注视超出画面时,模型能有效抑制注视可能性,例如在 MMDB 上,图像外目标的热力图激活水平较低。
  • 移除 EYEDIAP 或 SynHead 数据集对显著性估计影响甚微,但架构选择(尤其是将双路径结构替换为 ROI 池化)导致性能显著下降(AUC 降至 0.700)。
  • “投影并比较”损失函数带来的增益有限,可能是因为 SynHead 与 EYEDIAP 数据集中的姿态变化相较于 GazeFollow 较少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。