[论文解读] Task Adaptive Parameter Sharing for Multi-Task Learning
本文提出任务自适应参数共享(TAPS),一种通过可微分方式为每个下游任务选择预训练模型中最小层数子集进行微调的方法,利用连续松弛和稀疏性正则化在性能与效率之间取得平衡。TAPS 在 ResNet、DenseNet 和视觉Transformer架构上实现了多任务学习的最先进准确率,相较于AdaShare仅引入0.46倍的更多任务特定参数,且在显著降低内存与参数开销的同时,达到与全微调相当的性能。
Adapting pre-trained models with broad capabilities has become standard practice for learning a wide range of downstream tasks. The typical approach of fine-tuning different models for each task is performant, but incurs a substantial memory cost. To efficiently learn multiple downstream tasks we introduce Task Adaptive Parameter Sharing (TAPS), a general method for tuning a base model to a new task by adaptively modifying a small, task-specific subset of layers. This enables multi-task learning while minimizing resources used and competition between tasks. TAPS solves a joint optimization problem which determines which layers to share with the base model and the value of the task-specific weights. Further, a sparsity penalty on the number of active layers encourages weight sharing with the base model. Compared to other methods, TAPS retains high accuracy on downstream tasks while introducing few task-specific parameters. Moreover, TAPS is agnostic to the model architecture and requires only minor changes to the training scheme. We evaluate our method on a suite of fine-tuning tasks and architectures (ResNet, DenseNet, ViT) and show that it achieves state-of-the-art performance while being simple to implement.
研究动机与目标
- 解决在多任务学习中为每个下游任务训练独立模型所导致的高内存与参数开销问题。
- 减少增量学习与联合多任务学习设置下的任务干扰与灾难性遗忘。
- 在不修改模型架构或手工设计规则的前提下,发现有效的、与模型架构相关的参数共享模式。
- 在对标准训练流程仅作最小修改的前提下,实现高效且可扩展的多任务学习。
- 在最小化任务特定参数数量的同时,实现与全微调相当的性能。
提出的方法
- TAPS 使用带有门控机制的任务特定权重增量,通过直通估计器将层选择建模为连续可微的优化问题。
- 在活跃(被微调)层的数量上引入稀疏性惩罚,以鼓励与预训练基础模型的共享。
- 通过随机梯度下降联合优化任务特定权重与层选择,实现端到端训练。
- TAPS 不修改模型架构,而是为每个任务重新训练现有层的一个小而自适应的子集。
- 该方法与模型架构无关,仅需对标准微调方案进行少量修改。
- 它能自动发现直观与非直观的共享模式——例如,在视觉Transformer中仅微调自注意力层,而共享前馈层。

实验结果
研究问题
- RQ1我们能否在不修改架构或手工设计规则的前提下,学习到在预训练模型中应微调哪些层?
- RQ2对层选择进行可微分的连续松弛,能否在最小化任务特定参数的同时,实现接近全微调的性能?
- RQ3在联合与增量多任务学习设置下,TAPS 是否优于现有参数共享方法(如AdaShare)?
- RQ4TAPS 能否自动发现有效的、与架构相关的共享模式,例如在视觉Transformer中聚焦于注意力层?
- RQ5与AdaShare这类两阶段方法相比,TAPS 在参数效率与训练成本方面表现如何?
主要发现
- 在ResNet-34上,TAPS在DomainNet上的表现达到最先进水平,在增量多任务学习设置下平均优于AdaShare 2.18%,且参数效率高出18%。
- 在联合多任务学习设置下,TAPS在DomainNet上的Top-1准确率达到80.28%,与全微调性能相当,同时仅引入比AdaShare多0.46倍的任务特定参数。
- TAPS 发现了任务特定且与架构相关的微调模式:对于ResNets,主要微调最后几层;对于视觉Transformer,则选择性地仅微调自注意力层。
- 与全微调在联合设置下因任务竞争导致性能下降不同,TAPS 在联合与增量训练中均保持稳定性能。
- 与需要昂贵的两阶段训练流程(包括策略学习与多次架构采样)的AdaShare相比,TAPS 的训练开销极低。
- 尽管使用了更大的网络(ResNet-50),AdaShare的性能仍略有下降,表明模型容量并非瓶颈——凸显了TAPS在效率与鲁棒性方面的优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。