Skip to main content
QUICK REVIEW

[论文解读] A Dilated Inception Network for Visual Saliency Prediction

Sheng Yang, Guosheng Lin|arXiv (Cornell University)|Apr 7, 2019
Visual Attention and Saliency Detection参考文献 57被引用 10
一句话总结

该论文提出了一种轻量级、端到端的空洞Inception网络(DINet),用于视觉显著性预测。该网络采用空洞Inception模块(DIM)以减少计算量,高效捕捉多尺度上下文特征。通过将显著性预测建模为基于线性归一化损失函数的概率分布预测任务,DINet在基准数据集上实现了最先进性能,且推理速度优于以往方法。

ABSTRACT

Recently, with the advent of deep convolutional neural networks (DCNN), the improvements in visual saliency prediction research are impressive. One possible direction to approach the next improvement is to fully characterize the multi-scale saliency-influential factors with a computationally-friendly module in DCNN architectures. In this work, we proposed an end-to-end dilated inception network (DINet) for visual saliency prediction. It captures multi-scale contextual features effectively with very limited extra parameters. Instead of utilizing parallel standard convolutions with different kernel sizes as the existing inception module, our proposed dilated inception module (DIM) uses parallel dilated convolutions with different dilation rates which can significantly reduce the computation load while enriching the diversity of receptive fields in feature maps. Moreover, the performance of our saliency model is further improved by using a set of linear normalization-based probability distribution distance metrics as loss functions. As such, we can formulate saliency prediction as a probability distribution prediction task for global saliency inference instead of a typical pixel-wise regression problem. Experimental results on several challenging saliency benchmark datasets demonstrate that our DINet with proposed loss functions can achieve state-of-the-art performance with shorter inference time.

研究动机与目标

  • 开发一种计算高效的深度学习架构,以有效捕捉用于视觉显著性预测的多尺度上下文特征。
  • 在保持或提升性能的同时,降低现有深度卷积神经网络(DCNNs)中多尺度特征提取模块的计算成本。
  • 通过将任务重新表述为概率分布预测问题,而非像素级回归,来提升显著性预测性能。
  • 与现有模型相比,实现最先进性能并具备更快的推理速度。

提出的方法

  • 提出一种空洞Inception模块(DIM),用不同膨胀率的并行空洞卷积替代标准卷积,以在不增加参数量或计算量的情况下扩展感受野。
  • 设计一个编码器-解码器全卷积神经网络,其中编码器使用DIM提取分层特征,解码器重建显著性图。
  • 引入一组基于线性归一化的概率分布距离度量作为损失函数,使模型以分布预测任务进行训练。
  • 采用端到端训练策略,结合所提出的损失函数,优化网络以实现全局显著性推理。
  • 在损失函数中引入线性正则化以稳定训练并提升泛化能力,替代传统的Softmax归一化。
  • 在多个基准数据集(SALICON、MIT1003、MIT300)上评估模型,使用AUC、CC、EMD和平均绝对误差(MAE)等标准指标。

实验结果

研究问题

  • RQ1空洞卷积能否有效替代Inception模块中的标准多分支卷积,在减少计算量的同时保持多尺度特征表示能力?
  • RQ2将显著性预测建模为概率分布预测任务,是否能优于标准回归或基于Softmax的损失函数?
  • RQ3采用所提出的DIM模块和损失函数的轻量级、端到端网络,能否实现最先进性能并具备更快的推理速度?
  • RQ4该模型在不同显著性数据集上的泛化能力如何,尤其是在新数据上微调后表现如何?

主要发现

  • DINet在SALICON和MIT1003数据集上达到最先进性能,在AUC、CC和EMD指标上优于现有模型。
  • 尽管精度更高,DINet的推理速度更快(在480×640分辨率下每张图像仅需0.06秒),显著优于DSCLRCN(0.27秒)。
  • 在MIT1003上微调后,模型在MIT300上的性能显著提升,表明其具备强大的泛化能力。
  • 所提出的基于线性归一化的损失函数在显著性预测准确率方面优于标准回归损失和基于Softmax的概率损失函数。
  • 尽管性能优异,当场景中存在多个显著对象时,模型仍表现不佳,因仅靠多尺度特征难以准确捕捉其相对重要性。
  • 在大多数指标上,DINet的性能与SAM或DSCLRCN相当或更优,且参数量更少、推理时间更短。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。