Skip to main content
QUICK REVIEW

[论文解读] Unifying Top-down and Bottom-up Scanpath Prediction Using Transformers

Zhibo Yang, Sounak Mondal|arXiv (Cornell University)|Mar 16, 2023
EEG and Brain-Computer InterfacesNeuroscience被引用 3
一句话总结

该论文提出HAT(人类注意力Transformer),一种基于统一Transformer的模型,无需将注视点离散化即可预测自上而下和自下而上的注视路径。通过使用模拟中央凹视网膜的机制和密集热力图预测,HAT在目标存在、目标不存在和自由观看任务中均实现了新的最先进性能,在COCO-Search18数据集上cNSS指标最高提升83%。

ABSTRACT

Most models of visual attention aim at predicting either top-down or bottom-up control, as studied using different visual search and free-viewing tasks. In this paper we propose the Human Attention Transformer (HAT), a single model that predicts both forms of attention control. HAT uses a novel transformer-based architecture and a simplified foveated retina that collectively create a spatio-temporal awareness akin to the dynamic visual working memory of humans. HAT not only establishes a new state-of-the-art in predicting the scanpath of fixations made during target-present and target-absent visual search and ``taskless'' free viewing, but also makes human gaze behavior interpretable. Unlike previous methods that rely on a coarse grid of fixation cells and experience information loss due to fixation discretization, HAT features a sequential dense prediction architecture and outputs a dense heatmap for each fixation, thus avoiding discretizing fixations. HAT sets a new standard in computational attention, which emphasizes effectiveness, generality, and interpretability. HAT's demonstrated scope and applicability will likely inspire the development of new attention models that can better predict human behavior in various attention-demanding scenarios. Code is available at https://github.com/cvlab-stonybrook/HAT.

研究动机与目标

  • 统一在一个模型中预测自上而下(目标导向)和自下而上(显著性驱动)的注视路径。
  • 克服先前模型中注视点离散化带来的局限性,该问题会导致信息损失并降低准确性。
  • 开发一种计算高效的密集预测框架,适用于高分辨率输入。
  • 构建一个具有可解释注意力机制、反映人类视觉工作记忆动态的认知上合理的模型。

提出的方法

  • HAT采用双分支CNN编码器,以不同视距提取多尺度特征图,模拟中央凹视网膜。
  • 使用带有可学习空间、时间与尺度嵌入的Transformer编码器,将视觉信息动态整合进工作记忆。
  • 在每一步预测密集的注视点热力图,避免将注视点粗粒度地离散化为网格单元。
  • 使用中央凹标记和周边标记分别表示中心和外围视觉信息,其中中央凹标记编码先前注视点的历史。
  • 自注意力机制从工作记忆中聚合信息,以预测下一个注视点位置。
  • 模型采用逐像素监督进行端到端训练,支持高分辨率、序列化的注视路径预测。

实验结果

研究问题

  • RQ1单一深度学习模型能否在无需为每类分别设计架构的前提下,有效预测自上而下和自下而上的注视路径?
  • RQ2避免注视点离散化对注视路径预测模型的准确性和泛化能力有何影响?
  • RQ3基于中央凹的Transformer工作记忆在多大程度上提升了注视路径预测中的时空感知能力?
  • RQ4HAT中的注意力权重在多大程度上反映了认知合理性以及人类视觉记忆动力学?
  • RQ5HAT架构中哪些组件对性能最为关键,它们如何促进可解释性?

主要发现

  • HAT在COCO-Search18和COCO-FreeView数据集上实现了新的最先进性能,在目标存在、目标不存在和自由观看设置下,cNSS分别提升83%、58%和72%。
  • 消融实验表明,移除中央凹标记导致性能下降最大(cIG下降近41%),证实其在维持工作记忆中的关键作用。
  • 空间和时间嵌入均具有显著贡献,分别在移除后使cIG下降21%和14%,凸显了对位置和时间意识的重要性。
  • 模型的注意力图显示,在目标不存在搜索的后期阶段,近期注视点占据主导,其模式与自由观看行为相似,验证了认知一致性。
  • HAT的密集预测方法避免了离散化损失,支持高分辨率注视路径预测,优于依赖粗粒度动作网格的先前方法。
  • 该模型展现出强大的泛化能力,在三种不同的注意力控制范式(目标存在、目标不存在和自由观看)中均达到SOTA性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。