Skip to main content
QUICK REVIEW

[论文解读] Model Spider: Learning to Rank Pre-Trained Models Efficiently

Yi-Kai Zhang, Ting-Ji Huang|arXiv (Cornell University)|Jun 6, 2023
Machine Learning and Data Classification被引用 5
一句话总结

Model Spider 提出了一种基于标记的、高效的方法,通过将预训练模型(PTMs)和下游任务编码为语义向量,对模型库中的 PTM 进行排序,从而在无需完整微调的情况下实现快速可迁移性估计。该方法在 PTM 选择任务中达到最先进性能,相比基线方法提速高达 1000 倍,同时在多种基准测试中保持了高排名准确率。

ABSTRACT

Figuring out which Pre-Trained Model (PTM) from a model zoo fits the target task is essential to take advantage of plentiful model resources. With the availability of numerous heterogeneous PTMs from diverse fields, efficiently selecting the most suitable PTM is challenging due to the time-consuming costs of carrying out forward or backward passes over all PTMs. In this paper, we propose Model Spider, which tokenizes both PTMs and tasks by summarizing their characteristics into vectors to enable efficient PTM selection. By leveraging the approximated performance of PTMs on a separate set of training tasks, Model Spider learns to construct tokens and measure the fitness score between a model-task pair via their tokens. The ability to rank relevant PTMs higher than others generalizes to new tasks. With the top-ranked PTM candidates, we further learn to enrich task tokens with their PTM-specific semantics to re-rank the PTMs for better selection. Model Spider balances efficiency and selection ability, making PTM selection like a spider preying on a web. Model Spider demonstrates promising performance in various configurations of model zoos.

研究动机与目标

  • 为解决从大规模异构模型库中高效选择最可迁移的预训练模型(PTM)的挑战。
  • 降低 PTM 选择的计算成本,因为通过完整微调评估所有模型的开销过高。
  • 学习一种通用的标记化与排序机制,使其能泛化到未见过的下游任务。
  • 在计算预算允许时,通过引入 PTM 特征实现效率与准确率之间的灵活权衡。
  • 通过利用排名靠前的 PTM 的任务特定特征,对初始排名进行优化,从而提升选择性能。

提出的方法

  • Model Spider 使用通用编码器将 PTM 和任务编码为可学习的向量标记,以捕捉其语义和功能特征。
  • 它采用基于 Transformer 的模块,计算任务标记与 PTM 标记之间的相似度得分,从而在无需前向传播的情况下估计可迁移性。
  • 该方法通过监督方式训练,利用历史任务-PTM 性能数据进行排名聚合,使排名靠前的 PTM 标记与对应的任务标记对齐。
  • 为提升准确率,通过在候选模型子集上进行前向传播,提取 PTM 特征,对排名靠前的 PTM 进行重新排序。
  • 该框架支持灵活的预算权衡:仅使用通用标记以实现最大速度,或添加 PTM 特征以获得更高准确率。
  • 整个流程端到端可微,支持对标记化与排序组件的联合优化。

实验结果

研究问题

  • RQ1我们能否在不执行完整微调的情况下,准确预测预训练模型对新下游任务的可迁移性?
  • RQ2如何在计算开销极小的前提下,高效地对大规模异构预训练模型库进行排序?
  • RQ3学习的标记化方案能否泛化到未见过的任务,在多样化领域中保持高排名准确率?
  • RQ4PTM 特征在多大程度上能提升选择准确率?这种提升与推理效率之间的权衡如何?
  • RQ5所提出的方法是否在速度和排名性能两方面均优于现有的基于前向传播的可迁移性代理方法?

主要发现

  • 在 ImageNet-1K 上,Model Spider 达到了 0.977 的加权 Kendall’s tau 相关系数,显著优于所有基线方法的排名准确率。
  • 该方法将 PTM 排名的平均运行时间从完整微调的 600,000 秒以上降低至仅 52.36 秒(无 PTM 特征),提速达 10,000 倍。
  • 在引入 42 个 PTM 特征后,Model Spider 的推理时间增加至 2,402.77 秒,但仍比完整微调快 250 倍。
  • 该模型在所有 18 个测试数据集上均保持高性能,包括 CIFAR-10、CUB-200 和 ImageNet-1K,展现出强大的泛化能力。
  • 消融实验证实,通用标记化与 PTM 特征增强均对排名性能有显著贡献。
  • Model Spider 的内存占用仅为 608 MB(无特征),使其在资源受限环境中具有实际部署可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。