[论文解读] Harvesting Discriminative Meta Objects with Deep CNN Features for Scene Classification
本文提出了一种新颖的场景分类流水线,利用深度卷积神经网络(CNN)特征,通过区域提议、无监督和弱监督筛选以及具有局部CNN微调的判别性聚类,挖掘具有判别性的元对象——语义相似、类别特定的视觉部件和对象组合。该方法在MIT Indoor 67(78.92%)和Sun397(75.12%)数据集上实现了最先进性能,通过聚合学习到的元对象的多尺度特征响应图实现。
Recent work on scene classification still makes use of generic CNN features in a rudimentary manner. In this ICCV 2015 paper, we present a novel pipeline built upon deep CNN features to harvest discriminative visual objects and parts for scene classification. We first use a region proposal technique to generate a set of high-quality patches potentially containing objects, and apply a pre-trained CNN to extract generic deep features from these patches. Then we perform both unsupervised and weakly supervised learning to screen these patches and discover discriminative ones representing category-specific objects and parts. We further apply discriminative clustering enhanced with local CNN fine-tuning to aggregate similar objects and parts into groups, called meta objects. A scene image representation is constructed by pooling the feature response maps of all the learned meta objects at multiple spatial scales. We have confirmed that the scene image representation obtained using this new pipeline is capable of delivering state-of-the-art performance on two popular scene benchmark datasets, MIT Indoor 67~\cite{MITIndoor67} and Sun397~\cite{Sun397}
研究动机与目标
- 为解决在场景分类中使用通用整体CNN特征的局限性,此类特征忽略了局部特征分布和判别性部件。
- 开发一种方法,以弱监督方式自动识别并从深度CNN特征中分组类别特定的视觉对象和部件。
- 通过元对象聚合判别性局部特征来改进场景表征,同时在多尺度下保留空间分布。
- 证明基于深度特征的局部、部件化表征在场景分类中优于全局CNN特征。
提出的方法
- 使用区域提议网络生成高质量图像块,以识别潜在的对象和部件。
- 使用预训练网络从所有提议的块中提取通用深度CNN特征。
- 为每个场景类别应用一类支持向量机(SVM)进行无监督异常值去除,仅保留该类别中频繁出现的块。
- 使用判别性权重执行弱监督块筛选,选择具有高类间可分性的块。
- 对筛选后的块进行判别性聚类,形成称为“元对象”的组,捕捉共享的语义意义。
- 在最终图像表征前,对每个元对象应用局部CNN微调,以优化其特征响应图,再进行多尺度空间池化。
实验结果
研究问题
- RQ1能否有效利用深度CNN特征来发现用于场景分类的类别特定视觉对象和部件?
- RQ2结合无监督和弱监督筛选在多大程度上提升了候选块的质量,从而促进元对象发现?
- RQ3将块聚类为元对象与将块视为独立视觉词相比,在表征能力上提升了多少?
- RQ4局部CNN微调在最终图像表征中如何影响元对象特征的判别性?
主要发现
- 所提出的流水线在MIT Indoor 67数据集上实现了78.92%的最先进识别准确率,优于先前方法。
- 在Sun397数据集上,该方法达到了75.12%的准确率,表明其在多样化场景类别中具有强大的泛化能力。
- 移除异常值去除步骤后性能下降2.6%,证实其在过滤非判别性块中的重要性。
- 与直接将筛选后的块作为词袋模型而不进行分组相比,判别性聚类使识别准确率提高了约6.1%。
- 局部CNN微调带来了2.8%的性能增益,表明其在优化元对象之间特征边界的效用。
- 跨数据集评估显示,在SUN397上微调的CNN在MIT Indoor 67上达到76.52%的准确率,表明所学习的元对象具有可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。