[论文解读] FiT: Parameter Efficient Few-shot Transfer Learning for Personalized and Federated Image Classification
FiT 提出了一种参数高效的 few-shot 迁移学习方法,用于个性化和联邦图像分类,通过结合冻结的 ImageNet 预训练主干网络与可训练的 FiLM 适配器层以及元学习的朴素贝叶斯分类器实现。它在 VTAB-1k 上实现了最先进(SOTA)的准确率,且参数量不足 BiT 的 1%,显著降低了低样本设置下的模型更新大小和通信成本。
Modern deep learning systems are increasingly deployed in situations such as personalization and federated learning where it is necessary to support i) learning on small amounts of data, and ii) communication efficient distributed training protocols. In this work, we develop FiLM Transfer (FiT) which fulfills these requirements in the image classification setting by combining ideas from transfer learning (fixed pretrained backbones and fine-tuned FiLM adapter layers) and meta-learning (automatically configured Naive Bayes classifiers and episodic training) to yield parameter efficient models with superior classification accuracy at low-shot. The resulting parameter efficiency is key for enabling few-shot learning, inexpensive model updates for personalization, and communication efficient federated learning. We experiment with FiT on a wide range of downstream datasets and show that it achieves better classification accuracy than the leading Big Transfer (BiT) algorithm at low-shot and achieves state-of-the art accuracy on the challenging VTAB-1k benchmark, with fewer than 1% of the updateable parameters. Finally, we demonstrate the parameter efficiency and superior accuracy of FiT in distributed low-shot applications including model personalization and federated learning where model update size is an important performance metric.
研究动机与目标
- 为解决个性化和联邦机器学习设置中数据有限且通信效率至关重要的低样本学习挑战。
- 将迁移学习的准确性与元学习的参数效率相结合,以提升模型更新效率。
- 在微调过程中减少可训练参数的数量,同时在多样化下游任务上保持高分类准确率。
- 通过最小化客户端与服务器之间传输的模型更新大小,实现通信高效的联邦学习。
- 在低样本个性化和联邦学习场景中,相比现有基线方法(如 BiT)展现出更优性能。
提出的方法
- 使用固定的、在 ImageNet-21K 上预训练的主干网络(BiT-M-R50x1)提取特征,所有参数保持冻结。
- 引入参数高效的 FiLM 适配器层,针对每个下游任务进行微调,实现仅用极少可更新参数的适应。
- 采用元学习的朴素贝叶斯分类器替代标准线性层,通过元学习的 episodic 训练方式,提升在低样本场景下的泛化能力。
- 应用基于度量学习的最后输出层,通过 episodic 的原型网络(ProtoNets)进行训练,以增强 few-shot 泛化能力。
- 采用两阶段训练策略:第一阶段在支持集上微调 FiLM 层;第二阶段以元学习方式在查询集上训练分类器。
- 在个性化和联邦学习设置中使用相同架构,其中客户端进行特定更新,服务器执行全局聚合。
实验结果
研究问题
- RQ1参数高效的适应方法是否能在远少于标准迁移学习可训练参数的前提下,实现比标准迁移学习更高的 few-shot 分类准确率?
- RQ2将元学习的分类器与参数高效的适配器结合,是否能提升在低样本和多样化下游任务上的性能?
- RQ3在客户端数据有限的联邦学习中,FiT 与 BiT 相比,在准确率和通信效率方面表现如何?
- RQ4FiT 是否能有效支持仅用极少数据的个性化模型更新,且更新大小极小?
- RQ5在 few-shot 图像分类中,使用 episodic 训练的朴素贝叶斯分类器是否优于标准线性分类器?
主要发现
- FiT 在 VTAB-1k 基准上实现了最先进(SOTA)的准确率,且可训练参数少于 BiT 的 1%。
- 在低样本设置(每类 2–10 个样本)下,FiT 在多个数据集(包括 CIFAR-100 和 Quickdraw)上的分类准确率均优于 BiT。
- 在联邦学习中,由于可更新参数显著减少,FiT 的通信成本相比 BiT 降低了数量级。
- 在个性化学习中,FiT 仅用每个用户少量样本即可实现高准确率,且模型更新大小最多比 BiT 小 100 倍。
- FiLM 适配器与元学习分类器的结合,相比标准线性头,能实现更好的泛化能力,尤其在低数据场景下。
- FiT 在多样化数据集上保持了强大的性能,包括与 ImageNet-21K 分布不同的数据集,证明了其在预训练分布之外的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。