[论文解读] Human Attention Estimation for Natural Images: An Automatic Gaze Refinement Approach
本文提出了一种隐式、与用户无关的方法,通过整合眼动追踪与计算显著性模型,实现实时自然图像中人类注意力的估计。通过利用基于网络摄像头的眼动估计与增量高斯混合模型聚类,并结合显著性优化,该方法在无需主动用户参与的情况下学习个体的注意力偏好,实现准确的个性化显著性图,从而支持个性化照片检索与标签建议等应用。
Photo collections and its applications today attempt to reflect user interactions in various forms. Moreover, photo collections aim to capture the users' intention with minimum effort through applications capturing user intentions. Human interest regions in an image carry powerful information about the user's behavior and can be used in many photo applications. Research on human visual attention has been conducted in the form of gaze tracking and computational saliency models in the computer vision community, and has shown considerable progress. This paper presents an integration between implicit gaze estimation and computational saliency model to effectively estimate human attention regions in images on the fly. Furthermore, our method estimates human attention via implicit calibration and incremental model updating without any active participation from the user. We also present extensive analysis and possible applications for personal photo collections.
研究动机与目标
- 在不依赖主动用户参与或专用硬件的前提下,估计自然图像中的人类注意力区域。
- 将隐式眼动估计与计算显著性模型相结合,基于个体的观看行为对注意力图进行优化。
- 通过被动观察照片浏览过程,实现实时、增量式学习用户特定的注意力偏好。
- 在个人照片集合中展示实际应用,包括显著性优化、标签建议与基于注意力的照片检索。
- 开发一种可扩展的即插即用解决方案,使用标准网络摄像头并进行最少校准,适用于现实世界部署。
提出的方法
- 使用网络摄像头捕获用户在自然照片浏览过程中的眼动位置,实现无需显式用户输入的隐式校准。
- 应用增量高斯混合模型(GMM)聚类,随时间学习用户特定的眼动分布模式。
- 通过模式搜索融合方法,将学习到的眼动分布与预训练的计算显著性模型相结合,以优化注意力图。
- 采用高效的增量学习流水线,实现实时更新GMM与高斯过程回归(GPR)模型。
- 在照片检索任务中,使用基于归一化显著性图重叠的相似性度量(Sim(s,t) = ∫ min(s(x), t(x)) dx)。
- 存储并更新GMM参数(均值、协方差、权重与计数估计),以降低在线更新时的计算成本。
实验结果
研究问题
- RQ1仅通过标准网络摄像头的隐式眼动估计,能否在无需主动用户校准的情况下有效捕捉个体的注意力偏好?
- RQ2将眼动数据与计算显著性模型结合,能否显著提升在自然场景中人类注意力预测的准确性?
- RQ3通过眼动数据实现的增量模型更新,在被动、非侵入性方式下,能在多大程度上随时间提升个性化程度?
- RQ4所提出的方法能否实现如显著性优化与基于注意力的照片检索等实际、用户特定的应用?
- RQ5在真实用户数据上,该方法在个性化与性能方面相较于最先进显著性模型表现如何?
主要发现
- 通过将眼动数据与计算显著性模型融合,所提方法实现了准确的个性化显著性图,显著减少了独立显著性模型中常见的误报。
- 增量GMM聚类在计算开销极小的情况下实现了有效的用户特定模型自适应,且在100次迭代内即实现收敛。
- 系统在正常照片浏览过程中被动学习用户注意力偏好,无需显式训练或交互步骤。
- 该方法可有效利用个人注意力区域作为查询实现照片检索,排名靠前的结果与用户兴趣区域高度匹配。
- 在标签建议应用中,该方法优于传统基于人脸检测的方法,能提出针对高注意力但非人脸区域的标签,这些区域常被传统方法忽略。
- 该方法在10名受试者中表现出鲁棒性,在个性化设置下相对于基线显著性模型均实现了稳定的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。