Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Learning for Fine-Grained Image Classification

Farha Al Breiki, Muhammad Ridzuan|arXiv (Cornell University)|Jul 29, 2021
Image Processing and 3D Reconstruction被引用 4
一句话总结

本文研究了自监督学习(SSL)在细粒度图像分类中的应用,采用三种掩蔽任务:拼图求解、对抗性超分辨率(SRGAN)和对比学习(SimCLR)。在木薯病害数据集上,下游验证准确率达到83%,表明SSL能够有效学习判别性特征,而无需大量人工标注,尽管其性能仍落后于88%的有监督基线模型。

ABSTRACT

Fine-grained image classification involves identifying different subcategories of a class which possess very subtle discriminatory features. Fine-grained datasets usually provide bounding box annotations along with class labels to aid the process of classification. However, building large scale datasets with such annotations is a mammoth task. Moreover, this extensive annotation is time-consuming and often requires expertise, which is a huge bottleneck in building large datasets. On the other hand, self-supervised learning (SSL) exploits the freely available data to generate supervisory signals which act as labels. The features learnt by performing some pretext tasks on huge unlabelled data proves to be very helpful for multiple downstream tasks. Our idea is to leverage self-supervision such that the model learns useful representations of fine-grained image classes. We experimented with 3 kinds of models: Jigsaw solving as pretext task, adversarial learning (SRGAN) and contrastive learning based (SimCLR) model. The learned features are used for downstream tasks such as fine-grained image classification. Our code is available at http://github.com/rush2406/Self-Supervised-Learning-for-Fine-grained-Image-Classification

研究动机与目标

  • 通过利用自监督学习(SSL)减少对昂贵且需专家标注的数据集在细粒度图像分类中的依赖。
  • 评估不同SSL掩蔽任务(拼图求解、对抗性超分辨率和对比学习)在细粒度分类中的有效性。
  • 探究自监督表示是否能够匹配或接近有监督模型在细粒度视觉识别任务中的性能。
  • 分析模型学习判别性特征(如纹理和形状)的能力,并识别在学习基于颜色的区分时存在的局限性。

提出的方法

  • 使用三种SSL方法在12,000张未标注的木薯叶片图像上预训练模型:拼图求解、基于SRGAN的超分辨率和SimCLR对比学习。
  • 对于拼图任务,图像被划分为3×3的图像块,模型预测正确的图像块排列方式,以促进空间和局部特征的学习。
  • 对于SRGAN,生成器被训练从低分辨率输入重建高分辨率图像,判别器则用于区分真实图像与生成图像。
  • 对于SimCLR,应用了诸如图像块互换、粗粒度丢弃和拼图等数据增强方法,以生成对比学习的正样本视图。
  • 在6,000张标注图像上使用学习到的特征进行下游分类,通过数据增强和类别权重处理类别不平衡问题。
  • 通过验证准确率评估模型性能,并使用Grad-CAM可视化分析模型学习到的关注区域和特征重要性。

实验结果

研究问题

  • RQ1自监督学习是否能在无需人工标注边界框或部件级监督的情况下,有效学习细粒度视觉表征?
  • RQ2在细粒度分类任务中,不同SSL掩蔽任务(拼图、对抗性超分辨率和对比学习)的性能如何比较?
  • RQ3自监督模型在多大程度上能够学习到如纹理和形状等判别性特征?在学习基于颜色的区分方面存在哪些局限性?
  • RQ4通过Dropout进行正则化是否能改善自监督模型中的特征学习,特别是在SRGAN的生成器中?
  • RQ5自监督模型是否能在细粒度分类任务中实现接近有监督基线的性能?

主要发现

  • 当分类器的Dropout率为0.5时,SRGAN生成器在下游分类任务中取得了最高的准确率83.3%,优于其他SSL方法。
  • 有监督基线模型达到了88%的准确率,表明尽管SSL具有潜力,但在该设定下仍落后于完全监督学习。
  • 拼图掩蔽任务在三种SSL方法中表现最差,表明其在该数据集中捕捉细粒度差异的能力有限。
  • Grad-CAM可视化显示,SRGAN生成器最初未能聚焦于叶片特征,但在加入Dropout后,开始关注相关叶片区域,其性能甚至超过了判别器。
  • 模型在利用颜色作为区分因素方面表现不佳,失败案例显示不同色调的叶片被错误分类。
  • Dropout正则化显著提升了特征学习效果,特别是在SRGAN生成器中,使其性能超越了判别器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。