[论文解读] Prototype Rectification for Few-Shot Learning
本文提出原型修正(Prototype Rectification)用于少样本学习,一种在归纳设置下通过伪标签和特征迁移减少原型网络中类内与类间偏差的方法。该方法在 miniImageNet 上实现 70.31%(1-shot)和 81.89%(5-shot)的最先进性能,并在 tieredImageNet 和 Meta-Dataset 等多个基准上展现出强大的泛化能力。
Few-shot learning requires to recognize novel classes with scarce labeled data. Prototypical network is useful in existing researches, however, training on narrow-size distribution of scarce data usually tends to get biased prototypes. In this paper, we figure out two key influencing factors of the process: the intra-class bias and the cross-class bias. We then propose a simple yet effective approach for prototype rectification in transductive setting. The approach utilizes label propagation to diminish the intra-class bias and feature shifting to diminish the cross-class bias. We also conduct theoretical analysis to derive its rationality as well as the lower bound of the performance. Effectiveness is shown on three few-shot benchmarks. Notably, our approach achieves state-of-the-art performance on both miniImageNet (70.31% on 1-shot and 81.89% on 5-shot) and tieredImageNet (78.74% on 1-shot and 86.92% on 5-shot).
研究动机与目标
- 为解决由于标注数据稀缺导致原型偏差引发的少样本学习性能下降问题。
- 识别并缓解限制原型表征能力的两个关键内在因素:类内偏差与类间偏差。
- 开发一种简单而有效的原型修正方法,以提升归纳少样本学习中的泛化能力。
- 为所提方法提供理论依据,包括性能下界推导及迁移项的推导。
- 在多个少样本学习基准(包括 miniImageNet、tieredImageNet 和 Meta-Dataset)上展示最先进性能。
提出的方法
- 提出一种偏差减小模块(BD-CSPN),结合伪标签与特征迁移,在归纳设置下修正原型。
- 利用高置信度未标注样本进行伪标签化,以减少类内偏差,通过加权平均避免引入新偏差。
- 引入迁移项 ξ,将查询特征与支持特征对齐,以减少类间偏差。
- 采用基于余弦相似度的原型网络(CSPN)进行特征提取与初始原型计算。
- 推导性能的理论下界,表明样本数量与期望准确率之间存在正相关关系。
- 在基础类别训练中使用标准数据增强与优化设置(SGD 带动量、权重衰减)。
实验结果
研究问题
- RQ1类内与类间偏差如何影响少样本学习中原型的表征能力?
- RQ2基于置信度选择的伪标签能否在低数据场景下有效减少类内偏差?
- RQ3特征迁移是否能改善支持集与查询集分布之间的对齐,从而减少类间偏差?
- RQ4基于余弦相似度的原型网络的性能理论下界是什么?其与样本数量有何关系?
- RQ5一种结合伪标签与特征迁移的简单模块化方法是否能超越复杂的少样本学习模型?
主要发现
- 所提 BD-CSPN 在 miniImageNet 上实现 70.31% 准确率(1-shot)与 81.89%(5-shot),创下新最先进记录。
- 在 tieredImageNet 上,该方法达到 78.74%(1-shot)与 86.92%(5-shot),再次优于先前方法。
- 在 Omniglot 上,BD-CSPN 在 5-shot 10 类任务中准确率最高达 99.85%,展现出强大的鲁棒性与泛化能力。
- 在 CUB 上,与基线 CSPN 相比,该方法在 5-shot 设置下准确率提升超过 10%,达到 91.74%(使用 WRN-28-10)。
- 在更高类别数任务(最高达 1000 类)中,BD-CSPN 保持强劲性能,在 Meta-Dataset 上实现 85.87% 准确率(1000 类 5-shot)。
- 模型对未标注数据具有鲁棒性,当额外增加 5 个类别作为未标注样本时,5-shot 准确率仅下降 2.64%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。