Skip to main content
QUICK REVIEW

[论文解读] A linearized framework and a new benchmark for model selection for fine-tuning

Aditya Deshpande, Alessandro Achille|arXiv (Cornell University)|Jan 29, 2021
Domain Adaptation and Few-Shot Learning被引用 12
一句话总结

本文提出了一种用于少样本微调中模型选择的线性化框架,引入了标签-梯度相关性(LGC)和标签-特征相关性(LFC)作为简单但有效的基线方法。实验表明,这些方法在与实际微调准确率的排名相关性方面表现更优,且在从模型库中选择最优模型时所需尝试次数更少,在低数据场景下优于现有方法和暴力微调。

ABSTRACT

Fine-tuning from a collection of models pre-trained on different domains (a "model zoo") is emerging as a technique to improve test accuracy in the low-data regime. However, model selection, i.e. how to pre-select the right model to fine-tune from a model zoo without performing any training, remains an open topic. We use a linearized framework to approximate fine-tuning, and introduce two new baselines for model selection -- Label-Gradient and Label-Feature Correlation. Since all model selection algorithms in the literature have been tested on different use-cases and never compared directly, we introduce a new comprehensive benchmark for model selection comprising of: i) A model zoo of single and multi-domain models, and ii) Many target tasks. Our benchmark highlights accuracy gain with model zoo compared to fine-tuning Imagenet models. We show our model selection baseline can select optimal models to fine-tune in few selections and has the highest ranking correlation to fine-tuning accuracy compared to existing algorithms.

研究动机与目标

  • 为解决少样本微调中的模型选择这一开放性问题,即在不进行训练的情况下从模型库中选择最佳预训练模型至关重要。
  • 构建一个理论与实证相结合的框架,通过在预训练权重附近进行线性化,近似微调行为。
  • 引入一个全面的基准测试,包含多样化的模型库和多个目标任务,以公平比较不同模型选择方法。
  • 在统一设置下评估并比较最先进模型选择方法与新型基线方法(LGC与LFC)。
  • 证明简单的线性化度量可与复杂方法相媲美甚至超越,从而在微调中选择最优模型。

提出的方法

  • 本文通过神经正切核(NTK)对微调过程进行线性化近似,以分析预训练权重附近的模型行为。
  • 推导出两种模型选择标准:标签-梯度相关性(LGC),用于衡量标签向量与梯度方向之间的对齐程度;标签-特征相关性(LFC),用于衡量标签向量与特征表示之间的相关性。
  • 构建了一个大规模基准测试,包含8个多样化图像数据集,形成一个由单领域和多领域专家组成的模型库,并设置多个目标任务用于评估。
  • 通过测量选择最佳模型所需的尝试次数,以及模型选择得分与实际微调准确率之间的Spearman等级相关性,评估模型选择性能。
  • 该框架通过在无需完整微调的情况下对模型进行排序,实现了高效的模型选择,显著降低了计算成本。
  • 实验在不同设置下对比了LFC、LGC与现有方法(LEEP、RSA、领域相似性、特征度量)的表现,涵盖完整数据和少样本数据场景。

实验结果

研究问题

  • RQ1线性化微调近似是否能在无需完整微调的情况下有效指导模型选择?
  • RQ2LGC与LFC在准确率和选择效率方面与现有模型选择方法相比如何?
  • RQ3使用领域特定专家组成的模型库是否能相比ImageNet预训练,在微调中取得更高的准确率,尤其是在低数据场景下?
  • RQ4模型选择得分与实际微调性能之间的相关性在多大程度上成立?
  • RQ5模型选择能否减少识别最优微调模型所需尝试的次数?

主要发现

  • 从所提出的模型库进行微调的表现优于使用ImageNet预训练模型的标准微调方法,尤其在低数据场景下(5、10、20-shot),测试误差更低。
  • LFC与LGC在所有目标任务中与实际微调准确率的Spearman等级相关性最高(0.85–0.90),优于RSA、LEEP和领域相似性方法。
  • 在包含30名单领域专家的模型库中,LFC与LGC在少于7次尝试内即可选出最佳模型;在包含8名多领域专家的模型库中,少于3次尝试即可完成选择。
  • 使用LFC与LEEP进行模型选择可显著减少对暴力微调的需求,节省大量计算资源,同时保持或提升准确率。
  • 与在ImageNet预训练ResNet-101上的超参数优化(HPO)相比,模型库方法在低数据场景下取得了更高的准确率增益。
  • LFC得分可作为微调准确率的强代理指标,使无需训练即可实现可靠模型排序与选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。