Skip to main content
QUICK REVIEW

[论文解读] Visual saliency estimation by integrating features using multiple kernel learning

Yasin Kavak, Erkut Erdem|arXiv (Cornell University)|Jul 22, 2013
Visual Attention and Saliency Detection参考文献 46被引用 8
一句话总结

该论文提出了一种基于多核学习(MKL)的视觉显著性估计框架,整合了来自ObjectBank滤波器库的低层次视觉特征与高层次的特定对象特征。通过利用MKL实现自适应特征组合,并引入大规模对象检测器的语义响应,该方法在MIT1003和Toronto数据集上实现了最先进性能,AUC得分分别达到0.841和0.836,优于基于SVM和AdaBoost的模型。

ABSTRACT

In the last few decades, significant achievements have been attained in predicting where humans look at images through different computational models. However, how to determine contributions of different visual features to overall saliency still remains an open problem. To overcome this issue, a recent class of models formulates saliency estimation as a supervised learning problem and accordingly apply machine learning techniques. In this paper, we also address this challenging problem and propose to use multiple kernel learning (MKL) to combine information coming from different feature dimensions and to perform integration at an intermediate level. Besides, we suggest to use responses of a recently proposed filterbank of object detectors, known as Object-Bank, as additional semantic high-level features. Here we show that our MKL-based framework together with the proposed object-specific features provide state-of-the-art performance as compared to SVM or AdaBoost-based saliency models.

研究动机与目标

  • 为解决如何确定多样化视觉特征对整体显著性预测贡献的开放性问题。
  • 通过使用多核学习(MKL)实现特征图的非线性、自适应融合,改进显著性模型中的特征集成。
  • 探索使用大规模、特定对象的滤波器库(ObjectBank)作为高层语义特征,以建模自上而下的注意力调制。
  • 评估基于MKL的集成方法在使用完整特征集和仅对象级特征时的有效性,并与已建立的学习模型进行性能比较。

提出的方法

  • 该框架将显著性估计建模为一个监督学习问题,使用真实眼动数据作为训练标签。
  • 采用多核学习(MKL)变体——特别是正则化块MKL(RBMKL)——在中间集成层学习特征图的最优非线性组合。
  • 通过高斯差分法计算中心-周围差异,提取低层次视觉特征(如强度、颜色、方向),在多尺度下生成特征图。
  • 高层语义特征源自ObjectBank滤波器库,该库为100多个物体类别提供检测器响应,捕捉特定物体的显著性线索。
  • MKL框架学习对应于不同特征类型的核矩阵的加权组合,实现超越简单线性求和的灵活集成。
  • 使用结构化SVM方法与合页损失函数进行模型训练,以优化像素级显著性标签的分类准确率。

实验结果

研究问题

  • RQ1与线性方法相比,多核学习是否能通过实现多样化视觉特征的非线性、自适应集成来提升显著性预测性能?
  • RQ2大规模滤波器库(ObjectBank)中的特定对象特征在增强显著性估计方面有多有效,尤其是在单独使用时?
  • RQ3所提出的基于MKL的框架是否优于传统的基于学习的模型(如SVM和AdaBoost)?
  • RQ4高层对象响应在多大程度上促进了显著性预测?它们能否实现与经典自下而上模型相当的性能?
  • RQ5与早期融合或晚期融合相比,MKL的集成策略在建模特征依赖关系和预测准确性方面表现如何?

主要发现

  • 基于RBMKL的模型在MIT1003数据集上取得了0.841的AUC得分,优于所有基线方法,包括SVM(0.821)、AdaBoost(0.808)和NLMKL(0.821)。
  • 在Toronto数据集上,RBMKL模型在使用完整特征时AUC达到0.836,超过次优方法(SVM为0.821),并显著优于仅使用对象级特征的模型。
  • 即使仅使用基于ObjectBank的特征,RBMKL模型在Toronto数据集上仍取得了0.736的AUC,表现出色,与经典Itti等人自下而上的模型(AUC为0.741)相当。
  • 在MIT1003数据集上,仅使用对象级特征时,AUC达到0.752,表明对象特定线索对显著性预测具有高度信息量。
  • 所提出的MKL框架在泛化能力和鲁棒性方面优于线性方法,这从重复实验中性能标准差更低可得证实。
  • 使用完整特征的RBMKL进行视觉显著性预测,在定位显著区域方面表现更优,尤其在物体周围区域,如图3和图4的定性比较结果所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。