[论文解读] The Semi-Supervised iNaturalist-Aves Challenge at FGVC7 Workshop
本论文提出了 Semi-Aves,一个用于细粒度视觉识别的半监督学习基准,包含1,000种鸟类,其中200种为类内类别(3,959张标注图像),800种为类外新类别(122,208张未标注图像),旨在反映现实世界中的挑战,如类别不平衡、领域偏移和迁移学习。最佳方法在测试集上达到了90.1%的Top-1准确率,其中在类内未标注数据上进行伪标签化最为有效,而类外数据带来的增益有限。
This document describes the details and the motivation behind a new dataset we collected for the semi-supervised recognition challenge~\cite{semi-aves} at the FGVC7 workshop at CVPR 2020. The dataset contains 1000 species of birds sampled from the iNat-2018 dataset for a total of nearly 150k images. From this collection, we sample a subset of classes and their labels, while adding the images from the remaining classes to the unlabeled set of images. The presence of out-of-domain data (novel classes), high class-imbalance, and fine-grained similarity between classes poses significant challenges for existing semi-supervised recognition techniques in the literature. The dataset is available here: \url{https://github.com/cvl-umass/semi-inat-2020}
研究动机与目标
- 为解决当前半监督学习(SSL)基准缺乏真实世界挑战(如类别不平衡和新类别)的问题。
- 构建一个数据集,以在真实条件下评估 SSL 方法,包括标注数据与未标注数据之间的领域偏移。
- 研究 ImageNet 预训练模型对细粒度视觉识别中 SSL 性能的影响。
- 在 FGVC7 上举办挑战赛,以评估最先进 SSL 技术在真实、大规模鸟类识别数据集上的表现。
提出的方法
- 数据集从 iNaturalist-2018 数据集中选取的1,000种鸟类构建,其中200种指定为类内(标注),800种为类外(未标注)。
- 类内标注图像(3,959张)来自200种类内物种,每类至少5张图像,其余26,640张类内图像用作类内未标注数据。
- 类外未标注数据(122,208张图像)来自800种额外鸟类,以模拟新类别并引入领域偏移。
- 验证集和测试集分别按每类10张和40张图像构建,确保类别分布均匀。
- 参赛者可使用 ImageNet-1k 预训练模型,但不可使用在 iNaturalist 上微调的模型,以隔离迁移学习的影响。
- 挑战采用两阶段测试划分:50% 公开用于排行榜更新,50% 私有用于最终排名。
实验结果
研究问题
- RQ1在存在显著类别不平衡且标注与未标注数据之间存在领域偏移的基准上,现有半监督学习方法表现如何?
- RQ2从 ImageNet 进行迁移学习在半监督细粒度鸟类识别中能在多大程度上提升性能?
- RQ3将类外(新)未标注数据纳入是否能提升模型泛化能力,还是因领域偏移导致性能下降?
- RQ4在具有细粒度类别的现实 SSL 设置中,最有效的数据增强和集成策略是什么?
- RQ5为何最先进 SSL 方法(如 MixMatch 和 FixMatch)在此设置中改善有限?
主要发现
- 最佳方法在私有测试集上达到 90.1% 的 Top-1 准确率,显著优于从 ImageNet 微调的基线模型(43.3% Top-1)。
- 在获胜方法中,对类内未标注数据进行伪标签化被证明是最有效的技术,表明在类别不平衡条件下自训练具有强效用。
- 尽管领域相似,类外未标注数据带来的增益有限,表明领域偏移会阻碍来自新类别的知识迁移。
- 有团队报告称,在类外数据上进行基于聚类的预训练可提升性能,优于仅使用 ImageNet 预训练,挑战了领域对齐的既有假设。
- 广泛的数据增强和模型集成始终有效,优于复杂 SSL 算法(如 MixMatch 和 FixMatch)在此设置中的表现。
- 基准模型(69.0% Top-1)与最佳方法(90.1% Top-1)之间的差距表明,真实世界 SSL 应用仍有巨大提升空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。