Skip to main content
QUICK REVIEW

[论文解读] A Discriminative Representation of Convolutional Features for Indoor Scene Recognition

Salman Khan, Munawar Hayat|arXiv (Cornell University)|Jun 16, 2015
Advanced Image and Video Retrieval Techniques参考文献 58被引用 115
一句话总结

本文提出了一种新颖的判别性中层特征表示方法,通过使用多个场景代表性块(SRP)的码书,将结构化的卷积激活转换到更具判别性的空间,用于室内场景识别。通过结合来自新构建的大规模室内物体数据集(1,300个类别)的监督SRP与无监督SRP,并采用最大边缘超平面编码,该方法在五个主要场景分类基准上实现了最先进性能,显著优于先前方法,在处理类内差异性和类间相似性方面表现更优。

ABSTRACT

Indoor scene recognition is a multi-faceted and challenging problem due to the diverse intra-class variations and the confusing inter-class similarities. This paper presents a novel approach which exploits rich mid-level convolutional features to categorize indoor scenes. Traditionally used convolutional features preserve the global spatial structure, which is a desirable property for general object recognition. However, we argue that this structuredness is not much helpful when we have large variations in scene layouts, e.g., in indoor scenes. We propose to transform the structured convolutional activations to another highly discriminative feature space. The representation in the transformed space not only incorporates the discriminative aspects of the target dataset, but it also encodes the features in terms of the general object categories that are present in indoor scenes. To this end, we introduce a new large-scale dataset of 1300 object categories which are commonly present in indoor scenes. Our proposed approach achieves a significant performance boost over previous state of the art approaches on five major scene classification datasets.

研究动机与目标

  • 为解决室内场景识别中类内差异性高和类间相似性高的挑战。
  • 通过引入保留局部细节和结构关系的中层特征,改进传统全局或局部特征表示方法。
  • 开发一种鲁棒的特征编码方案,以增强复杂室内场景的判别能力。
  • 创建并发布首个与场景识别相关的1,300类室内物体大规模数据集。
  • 在多样且具有挑战性的室内场景分类数据集上展示优越性能。

提出的方法

  • 从深层卷积特征中提取密集且均匀的图像块,以形成中层表示。
  • 构建多个较小的场景代表性块(SRP)码书,结合来自新1,300类室内物体数据集的监督SRP与来自训练数据的无监督SRP。
  • 使用最大边缘超平面编码特征,以建模块与场景类别之间的判别性关联。
  • 在多个码书上应用最大池化,聚合判别性块响应以生成最终表示。
  • 采用稀疏编码和分类器相似性度量进行特征编码,并通过消融研究验证各组件的有效性。
  • 利用数据增强和块贡献热图提升模型的鲁棒性与可解释性。

实验结果

研究问题

  • RQ1从卷积特征中提取的中层表示是否能在室内场景识别中优于全局或局部表示?
  • RQ2在多个码书中结合监督与无监督SRP是否能相比单个码书提升分类准确率?
  • RQ3最大边缘超平面编码在捕捉用于场景分类的判别性块关系方面有多有效?
  • RQ4该方法在具有高杂波、尺度和姿态变化的数据集上的泛化能力如何?
  • RQ5大规模、语义标注的室内物体数据集在多大程度上能提升场景识别性能?

主要发现

  • 所提出的DUCA方法在UIUC 8-Sports数据集上达到98.7%的准确率,较之前最佳方法提升10.2%。
  • 在Graz-02数据集上,该方法达到98.6%的准确率,较先前最先进方法提升12.6%。
  • 监督与无监督码书的结合在MIT-67数据集上达到71.8%的准确率,优于单一组件及单个大型码书。
  • 多个较小码书相比单个大型码书,将每张图像的特征编码时间减少约20秒,同时保持或提升性能。
  • 在码书间进行最大池化取得最佳结果,在MIT-67数据集上准确率达到71.8%,高于均值池化的69.7%。
  • 热图显示,最具判别性的中层块对正确预测贡献最大,证实该方法聚焦于显著的场景元素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。