[论文解读] Exploring and Predicting Transferability across NLP Tasks
本文对33个NLP任务中的迁移学习进行了大规模实证研究,表明在多样化的源任务上微调BERT——即使这些源任务数据量少或与目标任务不相似——也能显著提升目标任务的性能,尤其是在数据稀缺的情况下。本文提出基于BERT梯度的任务嵌入,通过余弦相似度预测最具迁移性的源任务,从而在文本分类、问答和序列标注任务中实现可测量的性能提升。
Recent advances in NLP demonstrate the effectiveness of training large-scale language models and transferring them to downstream tasks. Can fine-tuning these models on tasks other than language modeling further improve performance? In this paper, we conduct an extensive study of the transferability between 33 NLP tasks across three broad classes of problems (text classification, question answering, and sequence labeling). Our results show that transfer learning is more beneficial than previously thought, especially when target task data is scarce, and can improve performance even when the source task is small or differs substantially from the target task (e.g., part-of-speech tagging transfers well to the DROP QA dataset). We also develop task embeddings that can be used to predict the most transferable source tasks for a given target task, and we validate their effectiveness in experiments controlled for source and target data size. Overall, our experiments reveal that factors such as source data size, task and domain similarity, and task complexity all play a role in determining transferability.
研究动机与目标
- 研究迁移学习在多样化NLP任务中提升性能的程度及条件。
- 识别影响迁移性的关键因素,如数据量、任务相似性、领域对齐程度和任务复杂度。
- 为低数据场景下的给定目标任务,开发一种可实际应用的预测最具迁移性源任务的方法。
- 创建一个公开可用的预训练模型和33个NLP任务任务嵌入库,以支持可复现且可扩展的迁移学习研究。
提出的方法
- 作者通过将数据集的所有样本输入BERT并聚合与特定任务损失相关的梯度,依据Achille等人(2019)提出的元学习原则计算任务嵌入。
- 每个任务仅需学习一次任务嵌入并存储在库中,从而实现基于相似度的高效源任务选择。
- 在迁移学习中,模型首先使用预测出的最相似任务嵌入对应的源任务进行微调,然后在目标任务上继续微调。
- 在三种任务类别(文本分类/回归、问答、序列标注)下,于多种数据设置(全量、有限、低数据)中评估迁移性能。
- 通过任务嵌入之间的余弦相似度识别与目标任务最相关的源任务,实现自动化源任务选择。
- 本研究采用STILTs流水线(Phang等人,2018),以BERT-Base Uncased作为基础模型,在目标任务微调前先在源任务上进行训练。
实验结果
研究问题
- RQ1在不同数据设置下,迁移学习在33个多样化NLP任务上的性能如何变化?
- RQ2当目标数据稀缺时,低数据量或语义上不相似的源任务在多大程度上能提升目标任务的性能?
- RQ3任务相似性、领域相似性、数据量和任务复杂度如何共同影响迁移性?
- RQ4基于BERT梯度的任务嵌入能否准确预测给定目标任务最具迁移性的源任务?
- RQ5与随机选择或启发式方法相比,所提出的方法在选择能带来可测量性能提升的源任务方面有多高效?
主要发现
- 即使源任务数据量小或与目标任务语义相距较远,迁移学习也能显著提升低数据量目标任务的性能。
- 当作为源任务时,词性标注(POS-PTB)在DROP问答数据集上实现了1.5%的绝对性能提升,表明其具备强大的跨任务迁移能力。
- 在全量→有限数据设置下,将SQuAD-1或SQuAD-2作为中间微调任务,可使POS-PTB和NER等序列标注任务的性能最高提升3.5%。
- 基于BERT梯度的任务嵌入捕捉到了有意义的任务特征,通过余弦相似度可准确预测最具迁移性的源任务。
- 在有限→有限数据设置下,使用预测的源任务在所有序列标注任务中均带来一致的性能提升,平均提升1.5%–2.5%。
- 研究发现,任务和领域相似性比数据量本身更具预测性,挑战了“源数据集越大越优”的既有假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。