[论文解读] The Stem Cell Hypothesis: Dilemma behind Multi-Task Learning with Transformer Encoders
本文提出了干细胞假说,解释了共享注意力头在Transformer编码器中天然擅长多种NLP任务,但在联合微调时由于优化信号冲突而性能受损。通过在五个核心NLP任务(POS、NER、DEP、CON、SRL)上进行广泛的剪枝和无参探测,作者表明多任务学习(MTL)的表现不如单任务学习,因为这些“干细胞”注意力头失去了任务特定的专业能力,导致所有任务性能下降。
Multi-task learning with transformer encoders (MTL) has emerged as a powerful technique to improve performance on closely-related tasks for both accuracy and efficiency while a question still remains whether or not it would perform as well on tasks that are distinct in nature. We first present MTL results on five NLP tasks, POS, NER, DEP, CON, and SRL, and depict its deficiency over single-task learning. We then conduct an extensive pruning analysis to show that a certain set of attention heads get claimed by most tasks during MTL, who interfere with one another to fine-tune those heads for their own objectives. Based on this finding, we propose the Stem Cell Hypothesis to reveal the existence of attention heads naturally talented for many tasks that cannot be jointly trained to create adequate embeddings for all of those tasks. Finally, we design novel parameter-free probes to justify our hypothesis and demonstrate how attention heads are transformed across the five tasks during MTL through label analysis.
研究动机与目标
- 探究为何在多样化的核心NLP任务上,使用共享Transformer编码器的多任务学习(MTL)表现不如单任务学习。
- 识别注意力头是否在不同任务间共享,以及其微调动态如何影响性能。
- 从注意力头竞争与干扰的角度,解释多任务学习失败的根本原因。
- 验证‘干细胞’注意力头的存在——这些头天然擅长多任务,但在联合训练下性能受损。
- 开发并应用无参探测方法,分析单任务与多任务设置下注意力头的行为。
提出的方法
- 在五个核心NLP任务(POS、NER、DEP、CON和SRL)上使用共享的BERT-based编码器进行多任务学习(MTL)。
- 通过广泛结构化剪枝识别每个任务的关键注意力头,揭示任务间存在高度重叠。
- 提出干细胞假说:某些注意力头天生具备多任务能力,但在联合微调时因梯度冲突而退化。
- 设计新型无参探测方法,无需额外参数即可评估注意力头在任务间的性能与表征变换。
- 使用动态与静态剪枝方法,测量单任务与多任务设置下头的利用率与性能权衡。
- 通过RGB编码的运行聚合可视化,追踪注意力头在各层与任务中的分配模式。
实验结果
研究问题
- RQ1为何使用共享Transformer编码器的多任务学习在多样化NLP任务上的表现低于单任务学习?
- RQ2注意力头在不同NLP任务间的共享程度如何,这种共享如何影响模型性能?
- RQ3是否存在具备天然多任务能力的注意力头?若存在,为何在联合训练下会失败?
- RQ4单任务与多任务微调下,探测结果与头利用率模式有何差异?
- RQ5无参探测方法能否有效揭示多任务学习中注意力头的行为特征及其性能退化?
主要发现
- 在全部五个任务上进行多任务学习(MTL-5)的表现始终低于单任务学习,其中SRL任务表现最差(83.56% vs. 83.52%的单任务表现)。
- 所有五个任务几乎依赖相同的注意力头集合,导致联合训练期间产生竞争与干扰。
- 无参探测显示,未为任何任务微调的头在语言结构上仍能实现高性能,证实了天然擅长的‘干细胞’头的存在。
- 单任务学习后,探测准确率与任务表现同步提升,表明干细胞头会演化为任务特定专家。
- 在多任务学习中,探测与任务性能均显著下降,支持了冲突信号导致头能力退化的假说。
- 头利用率分析显示,MTL-DP模型使用的头比例更高(如BERT中达53.47%),表明竞争加剧且分配效率降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。