Skip to main content
QUICK REVIEW

[论文解读] Saliency Preservation in Low-Resolution Grayscale Images

Shivanthan A.C. Yohanandan, Adrian G. Dyer|arXiv (Cornell University)|Dec 6, 2017
Visual Attention and Saliency Detection参考文献 43被引用 3
一句话总结

本文提出使用低分辨率灰度(LG)图像实现快速高效的视觉显著性检测,通过眼动追踪和深度学习实验表明,显著性信息在LG图像中得以保留。使用全卷积网络训练的LG模型在准确率上与高分辨率彩色模型相当,但训练速度提升14倍以上,推理速度接近10倍,使LG成为实时应用中计算性能更优的替代方案。

ABSTRACT

Visual salience detection originated over 500 million years ago and is one of nature's most efficient mechanisms. In contrast, many state-of-the-art computational saliency models are complex and inefficient. Most saliency models process high-resolution color (HC) images; however, insights into the evolutionary origins of visual salience detection suggest that achromatic low-resolution vision is essential to its speed and efficiency. Previous studies showed that low-resolution color and high-resolution grayscale images preserve saliency information. However, to our knowledge, no one has investigated whether saliency is preserved in low-resolution grayscale (LG) images. In this study, we explain the biological and computational motivation for LG, and show, through a range of human eye-tracking and computational modeling experiments, that saliency information is preserved in LG images. Moreover, we show that using LG images leads to significant speedups in model training and detection times and conclude by proposing LG images for fast and efficient salience detection.

研究动机与目标

  • 探究尽管计算成本极低,低分辨率灰度(LG)图像中是否仍保留显著性信息。
  • 将视觉显著性的进化起源所揭示的生物洞见与深度学习模型中的计算效率相衔接。
  • 评估在高分辨率彩色(HC)图像与低分辨率灰度(LG)图像上训练的全卷积网络(FCNs)在准确率与速度方面的性能表现。
  • 提出将LG图像作为高分辨率彩色图像在实时显著性检测中的计算高效替代方案。

提出的方法

  • 通过对比高分辨率彩色(HC)和低分辨率灰度(LG)图像上的注视点,开展人类眼动追踪实验,以评估感知相似性。
  • 从20名参与者处收集眼动追踪数据,其观看200对图像(HC与LG版本),以分析注视点重叠程度和观察者间一致性。
  • 使用相同的架构和超参数,在DUT-OMRON基准数据集的HC和LG版本上训练全卷积神经网络(FCNs)。
  • 采用RMSProp优化算法,基础初始学习率为0.05,在2000次迭代后按因子10降低,共训练100个周期,损失函数为均方误差。
  • 使用标准指标衡量模型性能:Judd-AUC、CC、SIM和NSS,预测结果上采样至与真实标签分辨率一致(1920×1080)。
  • 在NVIDIA Tesla K80 GPU上记录训练与检测时间,以比较HC与LG模型之间的计算效率。

实验结果

研究问题

  • RQ1与高分辨率彩色图像相比,低分辨率灰度图像中是否仍保留显著性信息?
  • RQ2人类在LG图像上的注视模式是否与在HC图像上的注视模式显著相关,表明感知相似性?
  • RQ3在LG图像上训练的全卷积网络能否实现与在HC图像上训练的模型相当的准确率?
  • RQ4使用LG图像是否能在不损失准确率的前提下,显著降低训练与推理时间?

主要发现

  • 在所有评估指标(Judd-AUC、CC、SIM、NSS)下,高分辨率彩色(HC)与低分辨率灰度(LG)模型之间无统计学显著差异,p > 0.05。
  • 眼动追踪结果显示,HC与LG图像之间的注视模式高度相似,观察者间一致性无显著差异。
  • LG模型的训练速度比HC模型快14倍以上,训练时间缩短至原时间的1/14。
  • LG模型实现近10倍的推理加速,生成显著性图仅需12毫秒,而HC模型需114毫秒。
  • 结果证实,显著性在LG图像中得到良好保留,支持了外围、非彩色、低分辨率视觉足以实现有效显著性检测的假设。
  • 本研究结论认为,LG图像在显著性检测中提供了高度高效的替代方案,准确率损失极小,同时获得显著的速度提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。