Skip to main content
QUICK REVIEW

[论文解读] A stochastic model of human visual attention with a dynamic Bayesian network

Akisato Kimura, Derek Pang|arXiv (Cornell University)|Apr 1, 2010
Visual Attention and Saliency Detection参考文献 29被引用 6
一句话总结

本文提出一种基于动态贝叶斯网络的随机视觉注意模型,用于预测视频场景中人类的眼动位置。通过结合显著性响应与认知状态动态,利用粒子滤波和流处理技术,该模型在预测人类注意力方面显著优于确定性模型,且具备接近实时的性能(40–50 ms/帧)。

ABSTRACT

Recent studies in the field of human vision science suggest that the human responses to the stimuli on a visual display are non-deterministic. People may attend to different locations on the same visual input at the same time. Based on this knowledge, we propose a new stochastic model of visual attention by introducing a dynamic Bayesian network to predict the likelihood of where humans typically focus on a video scene. The proposed model is composed of a dynamic Bayesian network with 4 layers. Our model provides a framework that simulates and combines the visual saliency response and the cognitive state of a person to estimate the most probable attended regions. Sample-based inference with Markov chain Monte-Carlo based particle filter and stream processing with multi-core processors enable us to estimate human visual attention in near real time. Experimental results have demonstrated that our model performs significantly better in predicting human visual attention compared to the previous deterministic models.

研究动机与目标

  • 解决人类视觉注意的非确定性本质,即个体在相同刺激上可能关注不同位置的问题。
  • 克服确定性显著性模型的局限性,后者假设每个刺激仅存在一个固定的关注点。
  • 构建一个概率框架,结合自下而上的显著性与自上而下的认知状态,以预测注意力发生的概率。
  • 实现实时估计人类视觉注意,为视频处理与计算机视觉中的实际应用提供支持。
  • 通过建模注意力响应中的不确定性,提升预测准确性,超越现有模型(如Itti的显著性图和贝叶斯突显性模型)

提出的方法

  • 构建一个四层动态贝叶斯网络(DBN),将视觉注意随时间的演化建模为隐马尔可夫过程。
  • 利用信号检测理论整合自下而上的显著性响应,将检测建模为具有高斯分布响应的目标与干扰物的随机过程。
  • 通过状态空间模型建模自上而下的认知状态,基于先前的关注状态预测眼动轨迹。
  • 应用基于马尔可夫链蒙特卡洛(MCMC)的粒子滤波进行基于样本的推理,以估计注意力位置的后验分布。
  • 在多核架构上采用流处理,实现在每帧40–50 ms的接近实时推理。
  • 将显著性似然与认知状态似然结合,形成联合概率模型,以估计最可能被注意的区域。

实验结果

研究问题

  • RQ1与确定性显著性模型相比,该随机模型在多大程度上能更好地捕捉人类视觉注意的非确定性本质?
  • RQ2整合认知状态动态在多大程度上提升了视频序列中注意力预测的准确性?
  • RQ3动态贝叶斯网络框架能否有效建模视觉注意的时序演化并实现近实时性能?
  • RQ4与现有确定性模型(如Itti的显著性图和贝叶斯突显性模型)相比,该模型在预测人类眼动位置方面表现如何?
  • RQ5该模型在帧处理时间方面的计算效率如何?是否能够实现接近实时运行?

主要发现

  • 所提出的随机模型在所有三个基线模型(方差、CIOFM、突显性)中均取得了显著更高的平均NSS得分,表明其预测准确性更优。
  • 在大多数视频片段中,该模型的性能优于或匹配现有模型,NSS得分始终高于零,且常超过1,表明预测注意力位置在人类眼动的一倍标准差范围内。
  • 与Itti模型生成多个大范围显著区域不同,该模型生成了更准确、更集中的注意力图,仅显示少数几个小范围显著区域。
  • 该模型实现了接近实时性能,每帧平均执行时间为40–50 ms,与Itti模型相当,即使未使用GPU加速。
  • 在CUDA加速下,该方法的处理时间保持相似,表明其在现代硬件上具备良好的可扩展性。
  • 通过整合信号检测理论与认知状态建模,该模型能够有效处理注意力响应中的不确定性,从而实现更稳健且更符合生物机制的预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。