Skip to main content
QUICK REVIEW

[论文解读] The iNaturalist Species Classification and Detection Dataset

Grant Van Horn, Oisin Mac Aodha|arXiv (Cornell University)|Jul 20, 2017
Smart Agriculture and AI参考文献 39被引用 16
一句话总结

本文介绍了iNaturalist物种分类与检测数据集,这是一个大规模、真实世界基准数据集,包含超过859,000张图像,覆盖5,000多个物种,具有极端类别不平衡、细粒度视觉相似性以及由公民科学验证的标签。尽管采用了最先进模型,顶级1准确率仅达到67%,凸显了在自然环境中长尾、细粒度视觉识别的挑战。

ABSTRACT

Existing image classification datasets used in computer vision tend to have a uniform distribution of images across object categories. In contrast, the natural world is heavily imbalanced, as some species are more abundant and easier to photograph than others. To encourage further progress in challenging real world conditions we present the iNaturalist species classification and detection dataset, consisting of 859,000 images from over 5,000 different species of plants and animals. It features visually similar species, captured in a wide variety of situations, from all over the world. Images were collected with different camera types, have varying image quality, feature a large class imbalance, and have been verified by multiple citizen scientists. We discuss the collection of the dataset and present extensive baseline experiments using state-of-the-art computer vision classification and detection models. Results show that current non-ensemble based methods achieve only 67% top one classification accuracy, illustrating the difficulty of the dataset. Specifically, we observe poor results for classes with small numbers of training examples suggesting more attention is needed in low-shot learning.

研究动机与目标

  • 为解决缺乏反映真实世界生物多样性挑战的现实、长尾、细粒度视觉识别数据集的问题。
  • 提供一个能捕捉极端类别不平衡的基准,正如自然界中某些物种被严重低估的情况。
  • 通过为许多类别提供稀疏的训练样本,支持低样本和少样本学习的研究。
  • 通过创建一个可扩展、社区驱动的数据集,支持保护与野外生物学研究,实现自动化生物多样性监测。
  • 探究当前计算机视觉模型是否能有效从代表性充分的物种泛化到稀有物种。

提出的方法

  • 数据集从iNaturalist公民科学平台收集,用户提交带有地理标签和时间戳的图像,并由多位专家验证物种标签。
  • 图像经过筛选,涵盖多样的相机类型、可变的图像质量以及全球地理分布,以确保真实世界中的多样性。
  • 数据集包含675,000张训练与验证图像,183,000张测试图像,以及超过560,000个手动创建的边界框用于目标检测。
  • 类别标签被划分为13个超类(例如Aves、Insecta、Mammalia),以支持模型性能的分层评估。
  • 使用最先进分类与检测架构(包括ResNeXt和Faster R-CNN)训练并评估基线模型。
  • 评估在多个粒度层级上进行:2,854个物种、9个超类和1个通用类别,以评估跨层级的可迁移性。

实验结果

研究问题

  • RQ1真实世界数据中的长尾类别分布是否显著降低最先进计算机视觉模型的性能?
  • RQ2在类别不平衡的数据上进行训练的模型,能否有效将知识从代表性充分的物种迁移到稀有物种?
  • RQ3模型性能在不同分类超类之间如何变化,尤其是样本数量较少的类别?
  • RQ4使用细粒度标签进行训练在多大程度上会降低在粗粒度超类检测任务上的性能?
  • RQ5在图像质量较低和遮挡严重的情况下,检测模型能否在小型、视觉上相似的物种上实现高精度?

主要发现

  • 最先进非集成分类模型在2,854类iNaturalist数据集上的顶级1准确率仅为67%,表明仍有巨大提升空间。
  • 稀有类别上的性能显著下降,Insecta和Reptilia的平均精度(AP)分别仅为49.4%和21.3%,凸显了低样本学习的挑战。
  • 检测性能在Arachnida(AP 43.9)和Mollusca(AP 34.8)中最高,但在Reptilia中最低(AP 21.3),反映出类别不平衡与视觉相似性的共同影响。
  • 使用细粒度标签进行训练会降低在粗粒度超类检测上的性能,1个通用类别检测的AP达到78.5%,表明粒度与泛化能力之间存在权衡。
  • 小型目标以及物种间高度视觉相似性是主要的失败模式,即使定位准确,仍可能导致性能下降,如失败案例分析所示。
  • 该数据集的长尾分布与真实世界多样性使其成为推动计算机视觉中低样本与少样本学习发展的强大平台。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。