[论文解读] Personalization of Saliency Estimation
本文提出一种基于条件深度卷积生成对抗网络(conditional Deep Convolutional GAN)的个性化显著性估计模型,通过整合观察者身份与特质(如年龄、语言熟练度)与图像刺激,生成针对特定观看者的注视预测。该模型通过标签条件化的生成器与判别器显式建模个体间视觉注意的差异,相较于非个性化基线模型,在自然图像与文本阅读任务中均实现了更高的AUC、NSS,更低的KL散度与MSE,显著提升了预测准确性。
Most existing saliency models use low-level features or task descriptions when generating attention predictions. However, the link between observer characteristics and gaze patterns is rarely investigated. We present a novel saliency prediction technique which takes viewers' identities and personal traits into consideration when modeling human attention. Instead of only computing image salience for average observers, we consider the interpersonal variation in the viewing behaviors of observers with different personal traits and backgrounds. We present an enriched derivative of the GAN network, which is able to generate personalized saliency predictions when fed with image stimuli and specific information about the observer. Our model contains a generator which generates grayscale saliency heat maps based on the image and an observer label. The generator is paired with an adversarial discriminator which learns to distinguish generated salience from ground truth salience. The discriminator also has the observer label as an input, which contributes to the personalization ability of our approach. We evaluate the performance of our personalized salience model by comparison with a benchmark model along with other un-personalized predictions, and illustrate improvements in prediction accuracy for all tested observer groups.
研究动机与目标
- 解决现有显著性模型缺乏个性化的问题,这些模型忽略了注意力分配中的个体差异。
- 建模个人特质(如年龄和语言背景)如何影响视觉注意模式,超越低层次特征与任务需求的影响。
- 开发一种深度学习框架,无需额外数据收集或数据集微调,即可生成准确的、针对观察者的显著性图。
- 在多种视觉场景(包括自然场景与文本阅读)中验证模型的有效性。
提出的方法
- 采用条件深度卷积生成对抗网络(DCGAN),其中生成器在图像输入与观察者身份标签的共同条件下生成灰度显著性热力图。
- 判别器被训练以区分真实显著性图(来自眼动追踪数据)与生成图,并同时接收观察者标签输入,以强化个性化效果。
- 生成器采用跳跃连接结构以保留空间细节,判别器则使用谱归一化与Leaky ReLU激活函数以提升训练稳定性。
- 观察者身份通过简单的独热嵌入编码,使模型能泛化至不同人口统计或语言群体,而无需详细问卷调查。
- 模型通过对抗损失端到端训练,生成器在最小化对抗损失的同时,生成与真实注视模式匹配的显著性图。
- 该方法具有模块化设计:可接受任意最先进模型(如MLNET)生成的显著性图作为输入,实现在无需从原始眼动追踪数据重新训练的前提下实现个性化。
实验结果
研究问题
- RQ1基于GAN的模型能否通过整合观察者身份与特质(如年龄或语言熟练度)有效实现显著性预测的个性化?
- RQ2在生成过程中引入个人特质后,与非个性化模型相比,注视预测的准确性如何变化?
- RQ3该模型在不同视觉刺激(包括自然图像与纯文本内容)上的泛化能力如何?
- RQ4模型输出是否反映了已知的注意力分配行为差异,例如年轻观察者注视更集中,而年长者注视更分散?
主要发现
- 个性化模型在显著性预测准确性上显著优于非个性化基线MLNET,AUC(p < 0.01)、NSS、KL散度与相似性指标在两组年龄群体中均有提升。
- 在年龄组对比中,模型为年轻观察者生成更集中、更紧凑的显著性图,为年长者生成更分散、更平滑的图——与Age Study数据集中实证发现一致。
- 在GECO数据集上,当使用正确身份标签时,模型对L1(母语)与L2(第二语言)读者的注视预测MSE均更低,表明具备上下文感知的个性化能力。
- 当输入错误标签(如L2内容使用L1标签)时,模型生成的显著性图表现出不匹配的注视模式——如L1读者出现更高跳读率,L2读者出现更多注视点——证实其行为依赖于标签。
- 模型成功为纯文本刺激生成个性化显著性图,表明个性化能力不仅适用于自然场景,也适用于阅读行为。
- 该方法无需额外数据收集或数据集构建,可直接使用预训练显著性图(如来自MLNET)作为输入,具有高度可适配性与高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。