[论文解读] An empirical study of pretrained representations for few-shot classification
本论文通过实证方法评估了预训练深度神经网络作为少样本图像分类的特征提取器,结果表明:在迁移性能方面,监督微调的 ImageNet 模型优于无监督和对抗鲁棒性模型。研究发现,在使用预训练特征时,余弦相似度在基于相似度的少样本方法中始终优于 L2 距离;且更深的、监督微调的主干网络在多种数据集上均能获得更优的少样本分类准确率。
Recent algorithms with state-of-the-art few-shot classification results start their procedure by computing data features output by a large pretrained model. In this paper we systematically investigate which models provide the best representations for a few-shot image classification task when pretrained on the Imagenet dataset. We test their representations when used as the starting point for different few-shot classification algorithms. We observe that models trained on a supervised classification task have higher performance than models trained in an unsupervised manner even when transferred to out-of-distribution datasets. Models trained with adversarial robustness transfer better, while having slightly lower accuracy than supervised models.
研究动机与目标
- 系统评估不同预训练模型在少样本图像分类任务中的迁移能力。
- 确定监督、无监督或对抗鲁棒性模型中,哪类模型能为少样本学习提供更优的特征表示。
- 探究在少样本分类中使用预训练特征时,相似度函数(如余弦相似度与 L2 距离)的影响。
- 评估在分布内和分布外数据集(包括 MNIST 和 SVHN)上的迁移性能。
- 识别在少样本学习中使用预训练主干网络的最佳实践,尤其与端到端训练模型进行对比。
提出的方法
- 本研究使用多种预训练卷积神经网络主干网络,在多个少样本分类方法中进行微调或适配,评估 14 个不同数据集的表现。
- 从每个预训练模型的最后隐藏层提取特征表示,不进行进一步训练,作为基于相似度的少样本分类器的输入。
- 采用三种适配方法:Matching Networks、Prototype Networks 和使用 SGD 的逻辑回归,每种方法均结合不同的相似度函数(余弦相似度、L2 距离、未归一化的点积)。
- 在 5-shot、10-shot 及更高少样本设置下测量性能,以评估方法随支持集规模增加的可扩展性。
- 实验对比了在 ImageNet 上使用监督、自监督和对抗鲁棒性目标预训练的模型,以评估其迁移能力。
- 结果在所有数据集上取平均,并以平均准确率报告,以支持跨模型和跨方法的比较。
实验结果
研究问题
- RQ1监督微调的 ImageNet 预训练模型在少样本图像分类中的迁移能力是否优于无监督或对抗鲁棒性模型?
- RQ2在使用预训练特征进行少样本分类时,相似度函数的选择(余弦相似度、L2 距离、点积)如何影响性能?
- RQ3当使用预训练特征时,少样本分类模型在分布内和分布外数据集上的性能是否存在显著差异?
- RQ4当从预训练模型中提取特征时,主干网络的深度和架构如何影响少样本分类准确率?
- RQ5在端到端训练的少样本学习中确立的最佳实践(如使用 L2 距离)在使用预训练特征时是否仍然有效?
主要发现
- 监督微调的 ImageNet 预训练模型在少样本图像分类中始终优于无监督和对抗鲁棒性模型,即使在 MNIST 和 SVHN 等分布外数据集上也是如此。
- 使用对抗鲁棒性预训练的模型在迁移到分布外数据集时性能下降较小,尽管其绝对准确率略低于标准监督模型。
- 无监督预训练方法未能达到与监督预训练相当的性能,也未能在少样本任务中实现更好的迁移。
- 在使用预训练特征时,余弦相似度作为相似度函数始终优于 L2 距离,这与端到端训练的少样本模型中的发现相反。
- 在 1-5 张支持样本时,基于相似度的方法(如使用余弦相似度的 Prototype Networks)表现最佳;在 10 张及以上支持样本时,微调最后全连接层(SGD 逻辑回归)更为有效。
- EfficientNet-B7 在所有数据集上表现出最强的鲁棒性,而 WSL 模型在最优超参数设置下达到最高的峰值准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。