Skip to main content
QUICK REVIEW

[论文解读] Modelling Local Deep Convolutional Neural Network Features to Improve Fine-Grained Image Classification

Zongyuan Ge, Chris McCool|arXiv (Cornell University)|Feb 27, 2015
Advanced Neural Network Applications参考文献 11被引用 4
一句话总结

该论文提出了一种通过降低内部全连接层的维度并选择性微调,实现局部深度CNN特征建模的方法,从而实现有效的高斯混合模型(GMM)拟合。该方法在Fish和UEC FOOD-100数据集上取得了最先进性能,相较于基线局部建模方法相对提升了14.9%,在食品识别任务中rank-1准确率高出9.4%。

ABSTRACT

We propose a local modelling approach using deep convolutional neural networks (CNNs) for fine-grained image classification. Recently, deep CNNs trained from large datasets have considerably improved the performance of object recognition. However, to date there has been limited work using these deep CNNs as local feature extractors. This partly stems from CNNs having internal representations which are high dimensional, thereby making such representations difficult to model using stochastic models. To overcome this issue, we propose to reduce the dimensionality of one of the internal fully connected layers, in conjunction with layer-restricted retraining to avoid retraining the entire network. The distribution of low-dimensional features obtained from the modified layer is then modelled using a Gaussian mixture model. Comparative experiments show that considerable performance improvements can be achieved on the challenging Fish and UEC FOOD-100 datasets.

研究动机与目标

  • 解决细粒度图像分类中类内差异大、类间差异小的挑战。
  • 克服传统统计模型(如GMM)在建模高维深度CNN特征时面临的维度灾难问题。
  • 开发一种高效方法,利用有限的细粒度数据适应深度CNN进行局部特征提取。
  • 通过使用GMM对从低维、微调后的CNN层中提取的局部特征进行建模,提升分类准确率。

提出的方法

  • 将预训练CNN中一个内部全连接层(fc-6)的维度降低,以支持有效的GMM建模。
  • 应用层受限微调,仅对降低后的层进行微调,避免全网络微调以节省计算资源。
  • 对每张图像的低维局部特征分布使用高斯混合模型(GMM)进行建模。
  • 在特征向量中引入空间位置(x,y)信息,以提升定位感知的表征能力。
  • 在GMM框架中使用通用背景模型(UBM)和仅均值MAP自适应方法进行类别特定建模。
  • 使用rank-n准确率和标准协议在Fish和UEC FOOD-100数据集上评估性能。

实验结果

研究问题

  • RQ1能否有效使用GMM对从网络内部层提取的低维深度CNN特征进行建模,以实现细粒度分类?
  • RQ2与全网络微调相比,对降低后的全连接层进行层受限微调是否能提升特征表征能力?
  • RQ3在细粒度识别任务中,学习到的深度特征的局部建模与全局特征表示相比表现如何?
  • RQ4在局部特征中引入空间坐标信息对分类性能有何影响?
  • RQ5该方法能否在Fish和UEC FOOD-100等基准细粒度数据集上实现最先进性能?

主要发现

  • 所提出的GMM-LDCNN方法在Fish数据集的协议1a下实现了53.8%的rank-1准确率,相较于先前最先进方法Local GMM相对提升了14.9%。
  • 在UEC FOOD-100数据集中,GMM-LDCNN实现了58.3%的rank-1准确率,相较于SVM-LDCNN基线相对提升了9.4%。
  • 扩展后的GMM-LDCNN-xy变体(引入空间坐标信息)在Fish数据集上进一步提升了性能,表明空间上下文信息在局部特征建模中的有益作用。
  • 该方法在两个数据集上均优于全局特征基线(SVM-CNN和SVM-LDCNN)以及PCA降维后的CNN特征(GMM-PCA-CNN)。
  • ISV建模在UEC FOOD-100上未提升性能,可能由于数据集为封闭集设置且每类训练图像数量较多。
  • Fish数据集的最优参数为C=1024、B=128、NU=128(协议1a),而协议1b下的最优参数为C=512、B=96、NU=128。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。