Skip to main content
QUICK REVIEW

[论文解读] The Semi-Supervised iNaturalist Challenge at the FGVC8 Workshop

Jong-Chyi Su, Subhransu Maji|arXiv (Cornell University)|Jun 2, 2021
Genomics and Phylogenetic Studies参考文献 4被引用 12
一句话总结

本论文提出了 Semi-iNat,一个大规模的半监督基准数据集,用于跨三个生物界(动物界、植物界、真菌界)的细粒度、长尾图像分类任务,包含33万张图像和2439个物种。该数据集仅使用粗分类标签(界/门)作为未标注数据的弱监督信号,评估了自监督学习方法。实验表明,使用 ImageNet 预训练可使 Top-1 准确率相比从零开始训练提升22%,但与最优性能相比仍有显著提升空间。

ABSTRACT

Semi-iNat is a challenging dataset for semi-supervised classification with a long-tailed distribution of classes, fine-grained categories, and domain shifts between labeled and unlabeled data. This dataset is behind the second iteration of the semi-supervised recognition challenge to be held at the FGVC8 workshop at CVPR 2021. Different from the previous one, this dataset (i) includes images of species from different kingdoms in the natural taxonomy, (ii) is at a larger scale -- with 810 in-class and 1629 out-of-class species for a total of 330k images, and (iii) does not provide in/out-of-class labels, but provides coarse taxonomic labels (kingdom and phylum) for the unlabeled images. This document describes baseline results and the details of the dataset which is available here: \url{https://github.com/cvl-umass/semi-inat-2021}.

研究动机与目标

  • 为细粒度、长尾及领域分布偏移设置下的半监督学习,填补真实、大规模基准数据集的缺失。
  • 通过引入来自三个界(动物界、植物界、真菌界)的物种,扩展先前的 Semi-Aves 基准,提升数据规模与多样性。
  • 在仅能获取未标注数据的粗分类标签(界/门)的现实条件下,评估半监督学习方法的性能。
  • 在 FGVC8 2021 上提供新挑战,测试模型在领域分布偏移和迁移学习局限性方面的鲁棒性,这些局限性在以往基准中已被观察到。
  • 推动弱监督与半监督方法的研究,利用易于获取的粗粒度标签来提升分类性能。

提出的方法

  • 数据集基于 iNaturalist 图像构建,排除了先前 iNaturalist 和 Semi-Aves 挑战中使用的物种,以避免重叠。
  • 根据分类学将物种划分为类内(C_in)和类外(C_out)集合,每门约1/3的物种分配至 C_in。
  • 对于 C_in 物种,分别保留5/10/10张图像用于验证、公开测试和私有测试;其余图像被划分为有标签(L_in)和无标签(U_in)集合,且每类至少保留5张有标签图像。
  • 所有 C_out 图像均包含在无标签集合 U_out 中,U_in 与 U_out 合并为单一无标签集合 U,且不提供任何领域标签。
  • 为所有无标签图像提供粗分类标签(界和门),作为弱监督信号。
  • 基线模型使用 ResNet-50、SGD 优化器和余弦退火学习率衰减进行训练,仅使用有标签数据评估 Top-1 和 Top-5 准确率(基线),并使用 U_in 的真实标签评估(模型为“oracle”)

实验结果

研究问题

  • RQ1在跨多个生物界的大型、长尾、细粒度数据集上,现有半监督学习方法的表现如何?
  • RQ2当未标注数据缺乏细粒度标签时,粗分类标签(界和门)能在多大程度上提升半监督学习性能?
  • RQ3在该具有挑战性的设置下,使用 ImageNet 预训练权重训练的模型与从零开始训练的模型相比,性能差异如何?
  • RQ4当无标签集合包含来自不同门和界的类外物种时,有标签与无标签数据之间的领域偏移对模型性能有何影响?
  • RQ5模型在不同门之间的混淆模式有何差异?这揭示了在长尾和领域分布偏移条件下细粒度分类的困难程度如何?

主要发现

  • 与从零开始训练相比,使用 ImageNet 预训练可使 Top-1 准确率提升22个百分点,证明了在该设置下预训练的价值。
  • 仅使用有标签数据训练的基线模型 Top-1 准确率为41.0%,表明通过更先进的半监督学习技术仍有巨大提升空间。
  • 使用全部可用标签(L_in ∪ U_in)的“oracle”模型达到94.3%的 Top-1 准确率,凸显当前方法与理论最优性能之间的显著差距。
  • 混淆矩阵显示,物种数量较少的门其模型准确率较低,且同类界内的混淆更频繁,表明同界内误分类是主要挑战。
  • 数据集在有标签和无标签训练集中均呈现长尾分布,各类别图像数量从5到400张不等,增加了学习鲁棒表征的难度。
  • 引入三个界(动物界、植物界、真菌界)和8个门的物种,显著提升了数据集的多样性与真实性,使其比以往的半监督基准更具挑战性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。