[论文解读] To Tune or Not to Tune? Adapting Pretrained Representations to Diverse Tasks
本文研究在将如 ELMo 和 BERT 等预训练语言模型适配至下游 NLP 任务时,应选择微调还是特征提取。研究发现,当预训练任务与目标任务高度相似或高度不相似时,微调优于特征提取;而当两者相似度处于中间水平时,特征提取已足够;选择取决于任务相似度,而非模型架构。
While most previous work has focused on different pretraining objectives and architectures for transfer learning, we ask how to best adapt the pretrained model to a given target task. We focus on the two most common forms of adaptation, feature extraction (where the pretrained weights are frozen), and directly fine-tuning the pretrained model. Our empirical results across diverse NLP tasks with two state-of-the-art models show that the relative performance of fine-tuning vs. feature extraction depends on the similarity of the pretraining and target tasks. We explore possible explanations for this finding and provide a set of adaptation guidelines for the NLP practitioner.
研究动机与目标
- 确定在多样化 NLP 任务中,针对预训练语言模型的最优适配策略——特征提取或微调。
- 探究预训练任务与目标任务之间的相似性如何影响微调与特征提取的相对性能。
- 为实践者提供基于实证的指导建议,明确何时应使用每种适配方法。
- 通过诊断分类器和互信息分析,研究 BERT 和 ELMo 在适配过程中不同层的信息含量。
- 理解尽管计算成本更高,为何在某些任务场景下微调表现更优。
提出的方法
- 在两种最先进的模型(ELMo 和 BERT)上,通过实证比较特征提取(权重冻结)与微调(权重更新)的方法。
- 在七个多样化的 NLP 任务上进行评估:命名实体识别(CoNLL-2003)、情感分析(SST-2)、自然语言蕴含(MultiNLI、SICK-E)、释义检测(MRPC)以及语义文本相似度(STS-B、SICK-R)。
- 使用在每一层隐藏表示上训练的诊断分类器,评估语言属性在模型特征中编码的充分程度。
- 采用 EDGE 估计器计算隐藏层激活与任务标签之间的互信息(MI),以量化适配过程中的信息流动。
- 分析不同预训练领域(如电话、小说、政府文档)下的表现,评估领域分布偏移的影响。
- 应用判别性微调和三角学习率调度策略,以提升微调的稳定性和性能。
实验结果
研究问题
- RQ1在何种条件下,微调在将预训练模型适配至下游任务时优于特征提取?
- RQ2预训练任务与目标任务之间的相似性如何影响微调与特征提取的相对性能?
- RQ3在模型架构中(即哪些层),任务相关的信息在微调前后最为集中?
- RQ4微调过程中,隐藏表示与标签之间的互信息如何变化?这揭示了关于知识获取的哪些信息?
- RQ5在模型架构(如 ELMo 与 BERT)或任务类型(如序列标注与句子对任务)不同的情况下,选择特征提取还是微调是否有所不同?
主要发现
- 当预训练任务与目标任务高度相似(如 NLI 预训练与 NLI 任务)或高度不相似(如 NLI 预训练用于序列标注任务)时,微调优于特征提取。
- 当预训练任务与目标任务中等相似时(如情感分析或命名实体识别),特征提取的性能与微调相当。
- 微调后表示的诊断分类器性能在所有层均提升,单句任务(如 CoLA、SST-2)中最终层提升最显著,而句子对任务(如 MRPC)则在中间层和最终层呈现渐进式改善。
- 微调后表示与标签之间的互信息显著高于预训练表示,尤其在深层网络中,表明微调增强了与任务相关信号的传播。
- 对于 BERT,若在不同领域(如政府文档)上进行微调,再在另一领域(如旅游)上评估时性能会下降,但微调仍优于特征提取,即使在领域分布偏移场景下。
- 在句子对任务中,微调与特征提取的性能差距最为显著,因为预训练表示在高层网络中几乎不含与任务相关的信息,这解释了为何需要微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。