Skip to main content
QUICK REVIEW

[论文解读] When Does Self-supervision Improve Few-shot Learning?

Jong-Chyi Su, Subhransu Maji|arXiv (Cornell University)|Oct 8, 2019
Domain Adaptation and Few-Shot Learning参考文献 69被引用 16
一句话总结

本文证明,自监督学习(SSL)在各类领域中显著提升了少样本元学习器的性能,尤其在训练数据稀缺或输入受损时效果更明显。通过使用领域分类器从大规模图像池中筛选出领域内未标注图像,该方法在不依赖外部数据或额外训练的情况下,性能超越仅使用领域内数据的设定,实现高达27%的相对误差降低。

ABSTRACT

We investigate the role of self-supervised learning (SSL) in the context of few-shot learning. Although recent research has shown the benefits of SSL on large unlabeled datasets, its utility on small datasets is relatively unexplored. We find that SSL reduces the relative error rate of few-shot meta-learners by 4%-27%, even when the datasets are small and only utilizing images within the datasets. The improvements are greater when the training set is smaller or the task is more challenging. Although the benefits of SSL may increase with larger training sets, we observe that SSL can hurt the performance when the distributions of images used for meta-learning and SSL are different. We conduct a systematic study by varying the degree of domain shift and analyzing the performance of several meta-learners on a multitude of domains. Based on this analysis we present a technique that automatically selects images for SSL from a large, generic pool of unlabeled images for a given dataset that provides further improvements.

研究动机与目标

  • 探究当训练数据有限时,自监督学习(SSL)是否能提升少样本学习性能。
  • 考察自监督与元学习数据之间的领域偏移对性能的影响。
  • 开发一种实用方法,从大规模通用图像池中筛选出对SSL有用的未标注图像,以适用于低资源少样本学习场景。
  • 在多种元学习器和多样化领域中评估SSL的有效性,包括输入受损的高难度任务。

提出的方法

  • 在元学习器训练过程中引入辅助自监督任务(如拼图、旋转预测),以正则化共享的特征主干网络。
  • 使用ResNet-101特征训练一个二分类领域分类器,以区分源领域数据与大规模未标注图像池。
  • 基于预测属于源领域的概率与图像池整体的比值,结合重要性权重以最小化领域偏移,选择SSL图像。
  • 在训练少样本元学习器(如ProtoNet)时使用所选图像进行自监督,且在五个基准数据集上保持一致的评估设置。
  • 对比使用领域内数据进行SSL、从大规模图像池中随机选择、基于领域加权的选择方法,以及使用原始数据80%作为“理想”参考(oracle)的性能表现。
  • 通过消融实验,改变数据集规模、输入质量(如灰度图、低分辨率)和领域偏移程度,以分离各因素的影响。

实验结果

研究问题

  • RQ1当仅有少量标注数据可用时,自监督学习是否能提升少样本元学习器的性能?
  • RQ2自监督数据与少样本训练数据之间的领域偏移如何影响性能?
  • RQ3我们能否自动从大规模通用图像池中筛选出高质量、领域相关的未标注图像,以提升少样本学习中的自监督效果?
  • RQ4自监督学习的优势是否随任务难度增加而增强,例如在更小的训练集或受损输入(如灰度图、低分辨率)下?
  • RQ5所提出的图像选择方法是否能超越随机选择和仅使用领域内数据的自监督方法?

主要发现

  • 即使仅使用同一数据集中的图像进行自监督,自监督学习仍能将少样本元学习器的相对误差率降低4%至27%。
  • 当基础训练集较小时,或输入受损(如灰度图或低分辨率)时,自监督学习的优势更加显著,表明其在高难度少样本场景中具有更高实用价值。
  • 从领域外来源添加未标注图像会损害性能,领域偏移对元学习器准确率有负面影响。
  • 从大规模未标注图像池中随机选择图像通常会降低性能,尤其在cars、dogs和flowers等数据集上表现更差。
  • 使用领域加权选择方法从大规模图像池中识别出领域内图像,其性能在所有五个评估数据集上均优于随机选择和仅使用领域内数据的自监督方法。
  • 所提方法的性能接近“理想”参考(使用原始数据80%进行自监督),证明其在低数据场景下的强大实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。