[论文解读] Learning a time-dependent master saliency map from eye-tracking data in videos
本文基于视频眼动追踪数据,采用最大似然与收缩方法(Lasso/EM)提出了一种时间与类别相关的显著性特征图融合方法。结果表明,最优特征权重(如中心偏置、动态显著性、人脸特征)在时间上和视频类别间存在显著差异,优于恒定权重融合模型。
To predict the most salient regions of complex natural scenes, saliency models commonly compute several feature maps (contrast, orientation, motion...) and linearly combine them into a master saliency map. Since feature maps have different spatial distribution and amplitude dynamic ranges, determining their contributions to overall saliency remains an open problem. Most state-of-the-art models do not take time into account and give feature maps constant weights across the stimulus duration. However, visual exploration is a highly dynamic process shaped by many time-dependent factors. For instance, some systematic viewing patterns such as the center bias are known to dramatically vary across the time course of the exploration. In this paper, we use maximum likelihood and shrinkage methods to dynamically and jointly learn feature map and systematic viewing pattern weights directly from eye-tracking data recorded on videos. We show that these weights systematically vary as a function of time, and heavily depend upon the semantic visual category of the videos being processed. Our fusion method allows taking these variations into account, and outperforms other state-of-the-art fusion schemes using constant weights over time. The code, videos and eye-tracking data we used for this study are available online: http://antoinecoutrot.magix.net/public/research.html
研究动机与目标
- 为解决静态、时间不变的特征权重在显著性模型中的局限性,此类权重无法捕捉动态视觉探索模式。
- 联合学习多个特征图(如运动、对比度、中心偏置)的时间可变权重以及来自真实眼动追踪数据的系统性观看偏置。
- 探究特征图贡献如何随时间和语义视频类别(如风景 vs. 有人脸的场景)而变化。
- 通过建模视频刺激中的时间动态与语义上下文,提升显著性预测的准确性。
- 通过从不同观察者群体(如文化或性别差异)的眼动追踪数据中学习,实现特定人群的显著性建模。
提出的方法
- 采用最大似然估计与收缩方法(Lasso与期望最大化EM),联合估计K个特征图在视频帧上的时间可变权重。
- 使用人类观察者观看多样化视频刺激的眼动追踪数据进行模型训练,权重按时间窗(如每40 ms或15帧)更新。
- 将主显著性图表述为加权线性组合:$ S = igsum_{k=1}^{K} eta_k^{(t)} M_k $,其中 $ eta_k^{(t)} $ 为时间依赖的权重。
- 应用Lasso正则化以促进稀疏性并防止过拟合,同时EM方法提升权重估计的收敛性与稳定性。
- 通过交叉验证验证模型性能,并与最先进恒定权重融合模型进行对比。
- 将语义视频类别(如风景、多个运动物体、人脸)作为影响权重动态的上下文因素引入。
实验结果
研究问题
- RQ1在视频观看过程中,自下而上与自上而下的显著性特征(如运动、对比度、中心偏置)的相对贡献如何随时间变化?
- RQ2特征图权重在多大程度上依赖于所处理视频的语义内容或视觉类别?
- RQ3时间依赖、数据驱动的显著性图融合能否优于传统恒定权重融合模型,在预测注视行为方面表现更优?
- RQ4系统性观看偏置(如中心偏置)在复杂场景视觉探索过程中如何动态演变?
- RQ5能否通过从其眼动追踪数据中学习,将该模型适配于不同观察者群体(如基于文化、年龄或性别)?
主要发现
- 特征图权重表现出显著的时间动态:中心偏置在前600 ms(15帧)占主导地位,之后进入持续阶段。
- 在含运动物体或人脸的视频中,动态显著性与人脸特征获得更高权重,而静态显著性权重在所有类别中均保持较低水平。
- 采用时间可变权重的模型在预测多样化视频刺激中的注视位置方面,优于所有恒定权重融合基线模型。
- 在人脸丰富的视频中,人脸区域解释了约80%的记录注视点,且动态显著性权重显著高于中心偏置权重。
- 该方法成功捕捉了眼动运动偏置(如中心偏置),并能适应语义内容,表现出在各类视频中的鲁棒性。
- 该方法实现了特定人群的显著性建模,表现为不同文化群体(如美国人与中国人)在物体注视行为中的权重动态存在差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。