[论文解读] Deep Ensembles for Low-Data Transfer Learning
本文提出了一种实用的方法,通过利用预训练多样性作为模型多样性的来源,在低数据微调迁移学习中从预训练模型构建深度集成。利用 k-NN 准确率对模型进行排序和选择,再通过交叉熵最小化贪心地构建集成,该方法在 19 个 VTAB 任务上实现了最先进性能,同时显著降低了推理成本——在不到六分之一 FLOPS 的情况下,超越了更大的最先进模型。
In the low-data regime, it is difficult to train good supervised models from scratch. Instead practitioners turn to pre-trained models, leveraging transfer learning. Ensembling is an empirically and theoretically appealing way to construct powerful predictive models, but the predominant approach of training multiple deep networks with different random initialisations collides with the need for transfer via pre-trained weights. In this work, we study different ways of creating ensembles from pre-trained models. We show that the nature of pre-training itself is a performant source of diversity, and propose a practical algorithm that efficiently identifies a subset of pre-trained models for any downstream dataset. The approach is simple: Use nearest-neighbour accuracy to rank pre-trained models, fine-tune the best ones with a small hyperparameter sweep, and greedily construct an ensemble to minimise validation cross-entropy. When evaluated together with strong baselines on 19 different downstream tasks (the Visual Task Adaptation Benchmark), this achieves state-of-the-art performance at a much lower inference budget, even when selecting from over 2,000 pre-trained models. We also assess our ensembles on ImageNet variants and show improved robustness to distribution shift.
研究动机与目标
- 解决在从零开始训练无效的低数据迁移学习场景中实现高性能的挑战。
- 克服标准集成方法依赖随机初始化或数据打乱的局限性,这些方法在使用预训练模型时不切实际。
- 将不同预训练方法和架构带来的固有多样性作为集成多样性的主要来源。
- 开发一种高效、可扩展的流程,从大型模型池(例如 2,000 个模型)中选择一小部分高性能预训练模型,用于下游微调和集成。
- 在最大化准确率和对分布偏移的鲁棒性的同时,最小化推理成本。
提出的方法
- 使用验证集上的留一法 k-NN 准确率作为廉价的代理指标,对特定下游任务中预训练模型的适用性进行排序。
- 根据其 k-NN 准确率选择前 k 个预训练模型,形成集成构建的初始候选池。
- 通过小规模超参数搜索(例如,调整初始化器、数据增强方式和随机种子)微调所选模型,以生成多样化的专家。
- 通过迭代地添加最能降低验证交叉熵损失的模型,贪心地构建最终集成。
- 基于交叉熵而非准确率进行集成选择,以减少在小验证集上的过拟合。
- 在多个下游任务和分布偏移的 ImageNet 变体上评估集成性能,以评估其鲁棒性和泛化能力。
实验结果
研究问题
- RQ1仅靠预训练多样性是否足以作为低数据迁移学习中有效深度集成的模型多样性来源?
- RQ2k-NN 准确率作为预测大规模预训练模型池中下游微调性能的代理指标有多有效?
- RQ3通过预训练多样性选择的模型集成,是否优于通过下游超参数或数据增强多样性形成的集成?
- RQ4基于交叉熵最小化的贪心集成选择策略,是否相比基于准确率的选择,在小验证集上能更有效地减少过拟合?
- RQ5与单模型或标准集成相比,此类集成在多大程度上提升了对分布偏移的鲁棒性?
主要发现
- 所提方法在视觉任务迁移基准(VTAB)上实现了最先进性能,SOTA 准确率绝对提升 1.8%。
- 基于上游预训练多样性的集成,在 19 个 VTAB 任务上平均比基于下游多样性的集成高出 1.2 个百分点。
- 该方法提升了对分布偏移的鲁棒性,在分布偏移的 ImageNet 变体上平均准确率提升 2.2%,优于基线集成。
- 最终集成在 VTAB 上达到 77.6% 的准确率,与性能更高的大模型(76.2%)相当,但 FLOPS 低于其六分之一,展现出卓越的效率。
- 基于交叉熵最小化的贪心集成选择策略泛化能力优于基于准确率的选择,测试性能随集成规模单调提升。
- 尽管进行了广泛的消融实验,但自助采样和替换策略未能减少过拟合,加权集成也未带来性能增益,凸显了基于交叉熵选择方法的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。