Skip to main content
QUICK REVIEW

[论文解读] K for the price of 1. Parameter efficient multi-task and transfer learning

Pramod Kaushik Mudrakarta, M. Sandler|arXiv (Cornell University)|Sep 27, 2018
Domain Adaptation and Few-Shot Learning被引用 19
一句话总结

本文提出一种参数高效的多任务和迁移学习方法,通过学习特定于任务的‘模型补丁’——即小规模参数集合(如缩放因子和偏置)——来替代微调整个网络。通过重用98%的预训练SSD特征提取器,并仅调整少量参数,该方法在显著减少参数更新的同时,实现了与完整微调相当的性能。

ABSTRACT

We introduce a novel method that enables parameter-efficient transfer and multi-task learning with deep neural networks. The basic approach is to learn a model patch - a small set of parameters - that will specialize to each task, instead of fine-tuning the last layer or the entire network. For instance, we show that learning a set of scales and biases is sufficient to convert a pretrained network to perform well on qualitatively different problems (e.g. converting a Single Shot MultiBox Detection (SSD) model into a 1000-class image classification model while reusing 98% of parameters of the SSD feature extractor). Similarly, we show that re-learning existing low-parameter layers (such as depth-wise convolutions) while keeping the rest of the network frozen also improves transfer-learning accuracy significantly. Our approach allows both simultaneous (multi-task) as well as sequential transfer learning. In several multi-task learning problems, despite using much fewer parameters than traditional logits-only fine-tuning, we match single-task performance.

研究动机与目标

  • 通过减少可训练参数的数量,解决在迁移学习和多任务学习中完整微调的低效问题。
  • 在不重新训练整个网络的前提下,支持顺序和并行的迁移学习。
  • 在重用大部分预训练权重的同时,保持下游任务的高性能。
  • 探究少量可学习参数补丁是否能有效将单一主干网络适配到多样化任务。

提出的方法

  • 该方法引入特定于任务的模型补丁,由一组少量可学习参数(如缩放因子和偏置)组成,附加到冻结的预训练网络上。
  • 这些补丁经过训练,以将预训练特征适配到特定任务,实现高效的参数化适应。
  • 该方法支持多任务学习(同时适配多个任务)和顺序迁移学习(一个任务接一个任务)。
  • 该方法允许重新训练低参数层(如逐通道卷积),同时保持其余网络层冻结,从而提高迁移学习的准确性。
  • 模型补丁应用于特征提取器之后,修改特征表示,再输入到最终的分类头。
  • 该方法保持原始网络架构不变,每项任务仅引入极少量额外参数。

实验结果

研究问题

  • RQ1少量可学习参数是否能有效将冻结的预训练网络适配到多样化的下游任务?
  • RQ2在多任务学习中,该方法的性能与完整微调和仅调整logits的适配方法相比如何?
  • RQ3在参数更新极少的情况下,同一特征提取器在多个任务中可重用的程度如何?
  • RQ4在保持其余层冻结的同时,重新训练低参数层是否能提高迁移学习的准确性?
  • RQ5该方法是否能在使用远少于标准微调参数的情况下,达到单任务的性能水平?

主要发现

  • 该方法在重用预训练SSD特征提取器98%参数的同时,性能与完整微调相当。
  • 尽管可训练参数远少于标准微调,该方法在多任务学习中仍能达到单任务的性能水平。
  • 在保持其余层冻结的同时重新训练低参数层(如逐通道卷积)能提高迁移学习的准确性。
  • 模型补丁能够有效适配到不同类型的任务,例如将目标检测模型转换为1000类图像分类器。
  • 该方法支持并行和顺序迁移学习,且参数更新极少。
  • 该方法展现出强大的参数效率,适用于资源受限环境的部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。