Skip to main content
QUICK REVIEW

[论文解读] Object-Level Representation Learning for Few-Shot Image Classification

Liangqu Long, Wei Wang|arXiv (Cornell University)|May 28, 2018
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

该论文提出了一种基于度量的少样本学习方法——物体级少样本学习(OLFSL),通过从大规模辅助数据集中学习到的物体级关系来提升少样本图像分类性能。通过提取并比较图像间的物体特征,并将这些关系聚合为图像级别的相似度得分,OLFSL在Omniglot数据集上达到最先进性能,在MiniImageNet数据集上,5-way 1-shot和5-way 5-shot设置下分别实现8.5%和2.7%的绝对性能提升,且无需微调。

ABSTRACT

Few-shot learning that trains image classifiers over few labeled examples per category is a challenging task. In this paper, we propose to exploit an additional big dataset with different categories to improve the accuracy of few-shot learning over our target dataset. Our approach is based on the observation that images can be decomposed into objects, which may appear in images from both the additional dataset and our target dataset. We use the object-level relation learned from the additional dataset to infer the similarity of images in our target dataset with unseen categories. Nearest neighbor search is applied to do image classification, which is a non-parametric model and thus does not need fine-tuning. We evaluate our algorithm on two popular datasets, namely Omniglot and MiniImagenet. We obtain 8.5\% and 2.7\% absolute improvements for 5-way 1-shot and 5-way 5-shot experiments on MiniImagenet, respectively. Source code will be published upon acceptance.

研究动机与目标

  • 解决由于每类标注样本有限,深度神经网络在少样本图像分类任务中表现困难的问题。
  • 通过利用跨不同数据集图像间共享的物体级组件来提升少样本学习的泛化能力。
  • 开发一种非参数化、无需微调的方法,通过最近邻搜索实现分类。
  • 从大规模辅助数据集中学习可泛化的物体级关系,以推断未见类别的图像相似度。
  • 在Omniglot和MiniImageNet等标准少样本基准上实现最先进性能。

提出的方法

  • OLFSL采用三模块框架:通过特征提取器 $\mathcal{F}_{\Phi}(x)$ 进行表示学习,从图像中提取物体特征。
  • 使用关系网络 $\mathcal{R}_{\theta}(a,b)$ 比较来自两幅图像的物体特征对,学习物体级关系。
  • 所有物体对的关系通过相似度网络 $\mathcal{S}_{\phi}(\cdot)\mapsto s_{ab}$ 聚合为单一的图像级相似度得分。
  • 模型在大规模辅助数据集(如ImageNet)上进行预训练,以学习通用的物体级关系,之后应用于目标少样本数据集。
  • 推理阶段通过使用学习到的相似度得分在目标数据集上进行最近邻搜索,避免微调。
  • 该方法与模型无关且可扩展,仅依赖特征提取和关系匹配。

实验结果

研究问题

  • RQ1从大规模多样化数据集中学习到的物体级关系是否能提升对未见类别的少样本图像分类性能?
  • RQ2在少样本设置中,通过组件级比较建模图像相似度为何优于整体图像嵌入方法?
  • RQ3非参数化、无需微调的方法在少样本学习中能在多大程度上实现最先进性能?
  • RQ4使用物体级表征是否能提升在不同少样本基准上的泛化能力?
  • RQ5该方法对图像分辨率和提取的物体区域数量在多大程度上敏感?

主要发现

  • OLFSL在Omniglot数据集上达到最先进性能,优于现有少样本学习方法。
  • 在MiniImageNet上,OLFSL在5-way 1-shot分类中实现8.5%的绝对性能提升,在5-way 5-shot分类中实现2.7%的提升。
  • 该方法对图像分辨率具有鲁棒性,当输入尺寸从84x84降至224x224时性能下降极小。
  • 物体区域数量($d^2$)对准确率有可测量但不剧烈的影响,最优性能出现在$d=10$时。
  • 该模型无需微调即可有效运行,仅依赖于预计算相似度得分的最近邻搜索。
  • 该方法在不同数据集间具有良好的泛化能力,展现出从辅助数据集到目标少样本任务的强零样本迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。