[论文解读] Saccade Sequence Prediction: Beyond Static Saliency Maps
该论文提出STAR-FC,一种基于深度学习的注视控制模型,通过整合中心视野与周边视野显著性及视网膜各向异性建模,预测时间有序的扫视序列。在CAT2000数据集上,其在前五个注视点的预测序列保真度与人类观察者间差异相当,优于静态显著性图模型。
Visual attention is a field with a considerable history, with eye movement control and prediction forming an important subfield. Fixation modeling in the past decades has been largely dominated computationally by a number of highly influential bottom-up saliency models, such as the Itti-Koch-Niebur model. The accuracy of such models has dramatically increased recently due to deep learning. However, on static images the emphasis of these models has largely been based on non-ordered prediction of fixations through a saliency map. Very few implemented models can generate temporally ordered human-like sequences of saccades beyond an initial fixation point. Towards addressing these shortcomings we present STAR-FC, a novel multi-saccade generator based on a central/peripheral integration of deep learning-based saliency and lower-level feature-based saliency. We have evaluated our model using the CAT2000 database, successfully predicting human patterns of fixation with equivalent accuracy and quality compared to what can be achieved by using one human sequence to predict another. This is a significant improvement over fixation sequences predicted by state-of-the-art saliency algorithms.
研究动机与目标
- 解决静态显著性图在预测时间有序扫视序列而非仅注视位置方面的局限性。
- 通过整合视网膜各向异性及中心/周边视觉处理,更准确地建模人类注视控制机制。
- 开发一种灵活、可参数调节的模型,可扩展用于任务导向与自上而下的注意力控制。
- 基于人类注视数据而非仅显著性图指标,评估序列预测性能,以反映真实世界的视觉行为。
提出的方法
- STAR-FC使用多扫视生成器,将基于深度学习的显著性图与基于低级特征的显著性相结合,实现中心视野与周边视野视觉场的整合。
- 该模型显式建模视网膜各向异性,考虑中央凹高分辨率与周边区域分辨率降低的特性,以提高空间精度。
- 注视控制网络基于显著性值选择扫视目标,结合回退抑制与空间注意力机制,防止重复注视。
- 模型在CAT2000数据集上进行训练与评估,采用轨迹度量(欧氏距离、弗雷chet距离、豪斯多夫距离)比较预测序列与人类注视序列。
- 性能与最先进显著性模型(如LDS、GBVS、SALICON)及中心点预测基线进行对比。
- 该模型设计为可扩展,支持任务导向调优与自上而下的注意力,可适应不同实验条件。
实验结果
研究问题
- RQ1计算模型能否生成比静态显著性图更准确匹配人类注视模式的时间有序扫视序列?
- RQ2显式建模视网膜各向异性在多大程度上提升了预测注视序列的保真度?
- RQ3整合中心与周边显著性在多大程度上提升了序列预测性能,相较于仅依赖显著性图的模型?
- RQ4所提模型在注视序列预测性能上与人类观察者间差异相比如何?
- RQ5该模型能否在具有不同观察者一致性水平的多样化图像类别上实现泛化?
主要发现
- STAR-FC在所有三项指标(ED、FD、HD)上的轨迹得分与人类观察者间比较相当,是唯一达到自然人类变异水平的模型。
- 在CAT2000数据集上,STAR-FC的注视分布均方误差与人类观察者相当,表明其具有高空间保真度。
- STAR-FC优于所有测试的显著性模型,包括LDS与GBVS,其与人类序列的欧氏距离降低20.6%,弗雷chet距离降低8.8%,豪斯多夫距离降低6.3%。
- 中心点预测基线虽与CAT2000的中心注视偏好一致,但在所有指标上表现最差,证明仅依赖中心偏倚不足以实现准确的序列预测。
- 该模型在图像类别上表现出稳健性能,如素描与低分辨率类别中一致性较高,而卡通与卫星图像类别中一致性较低,与先前关于观察者间一致性的发现一致。
- STAR-FC成功预测出与使用一人序列预测另一人序列质量相当的注视序列,为序列级注视预测设立了新基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。