[论文解读] GazeDPM: Early Integration of Gaze Information in Deformable Part Models
本文提出 GazeDPM,一种新颖的早期融合方法,在可变形部件模型框架内联合建模视觉特征与人类注视固定点,显著提升目标检测性能。在 POET 数据集上,相较于 DPM 基线模型,mAP 提升 4.3%,相较于近期的晚期融合方法,mAP 提升 3.9%,同时实现模型可解释性,并对注视噪声和显著性图替换具有鲁棒性。
An increasing number of works explore collaborative human-computer systems in which human gaze is used to enhance computer vision systems. For object detection these efforts were so far restricted to late integration approaches that have inherent limitations, such as increased precision without increase in recall. We propose an early integration approach in a deformable part model, which constitutes a joint formulation over gaze and visual data. We show that our GazeDPM method improves over the state-of-the-art DPM baseline by 4% and a recent method for gaze-supported object detection by 3% on the public POET dataset. Our approach additionally provides introspection of the learnt models, can reveal salient image structures, and allows us to investigate the interplay between gaze attracting and repelling areas, the importance of view-specific models, as well as viewers' personal biases in gaze patterns. We finally study important practical aspects of our approach, such as the impact of using saliency maps instead of real fixations, the impact of the number of fixations, as well as robustness to gaze estimation error.
研究动机与目标
- 为克服现有注视增强目标检测中晚期融合方法的局限性,这些方法无法提升召回率,且缺乏模态间的联合建模。
- 开发一种联合建模方法,从初始阶段即融合注视与视觉数据,以实现更丰富的模型可解释性,并更好地利用注视-视觉依赖关系。
- 评估在真实世界约束条件下(如注视数据噪声大、缺乏注视记录)注视增强检测的实际可行性。
- 探究显著性图是否可替代真实注视点以提升检测性能。
提出的方法
- 将可变形部件模型(DPM)扩展为使用统一的概率公式,联合建模梯度模式与注视固定点模式。
- 从真实眼动追踪数据构建注视密度图,以表征人类注意力的空间分布。
- 将注视与视觉特征整合进单一判别模型,学习对图像内容与观察者注意力均敏感的部件配置。
- 采用高斯噪声建模模拟注视估计误差,评估在真实噪声水平下的鲁棒性。
- 采用最先进的显著性模型(GBVS 与 BMS)生成合成注视图,用于消融研究。
- 可视化学习到的模型组件,以分析吸引注视与排斥注视的区域、视图特异性模式及个体观察者偏见。
实验结果
研究问题
- RQ1在可变形部件模型中,注视与视觉数据的早期融合是否能优于现有的晚期融合方法?
- RQ2当使用真实注视点与仅基于图像数据生成的显著性图时,所提方法的性能如何变化?
- RQ3GazeDPM 模型在注视估计噪声下具有多大程度的鲁棒性,特别是在真实传感器精度限制下?
- RQ4通过可视化 GazeDPM 模型内部结构,可获得关于注意力模式与物体认知的哪些洞见?
- RQ5个人注视偏见与视图特异性检测模式如何影响模型性能与可解释性?
主要发现
- 在 POET 数据集上,GazeDPM 相较于标准 DPM 基线模型,mAP 提升 4.3%。
- 与近期采用注视数据重评分检测结果的晚期融合方法相比,该方法在检测性能上提升了 3.9% mAP。
- 即使在模拟注视噪声的标准差约为图像高度 ±20% 的情况下,GazeDPM 仍保持相较于 DPM 的 1% mAP 提升。
- 当使用显著性图替代真实注视点时,GazeDPM 在 GBVS 下实现 0.8% mAP 提升,在 BMS 下实现 1% mAP 提升,表明全局显著性特征可部分替代真实注视数据。
- 模型可视化揭示了显著的图像结构,识别出吸引注视与排斥注视的区域,并暴露了观察者特定的偏见及视图依赖的检测模式。
- 该模型对注视估计误差表现出鲁棒性,仅在噪声水平远超真实传感器精度时性能才出现明显下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。