[论文解读] Fine-tuned Language Models are Continual Learners
本文提出持续-T0(CT0),一种通过使用1%回放缓冲区来保留对70项多样化NLP任务性能的微调语言模型,从而实现持续学习。该模型在未使用回放的情况下,对原始T0数据集仍能保持近乎完美的零样本性能,表明持续学习源于自监督预训练,而非指令微调或模型规模。
Recent work on large language models relies on the intuition that most natural language processing tasks can be described via natural language instructions. Language models trained on these instructions show strong zero-shot performance on several standard datasets. However, these models even though impressive still perform poorly on a wide range of tasks outside of their respective training and evaluation sets. To address this limitation, we argue that a model should be able to keep extending its knowledge and abilities, without forgetting previous skills. In spite of the limited success of Continual Learning we show that Language Models can be continual learners. We empirically investigate the reason for this success and conclude that Continual Learning emerges from self-supervision pre-training. Our resulting model Continual-T0 (CT0) is able to learn diverse new tasks, while still maintaining good performance on previous tasks, spanning remarkably through 70 datasets in total. Finally, we show that CT0 is able to combine instructions in ways it was never trained for, demonstrating some compositionality.
研究动机与目标
- 解决在学习新任务时微调语言模型出现灾难性遗忘的问题。
- 探究指令微调模型是否可在无灾难性遗忘的情况下充当持续学习者。
- 评估持续学习能力是否源于预训练,而非指令微调或模型规模。
- 证明仅使用小规模回放缓冲区(1%)即可在多样化语言生成任务上实现有效的持续学习。
- 探索持续学习模型中的指令组合性。
提出的方法
- 以微调后的T0模型为基础,在50个数据集上使用自然语言指令进行训练。
- 通过回放实现持续学习,即在训练新任务时存储并重放1%的旧任务数据。
- 模型按顺序在8个新的多样化语言生成任务上进行训练,包括俳句生成、共情回复生成以及带约束的标题生成。
- 在新任务和原始T0零样本评估数据集上评估性能,后者不使用回放。
- 消融研究比较了有无回放的模型,并分析了预训练、指令微调和模型规模在持续学习成功中的作用。
- 通过在推理时以新颖方式组合不同任务的指令来测试组合性。
实验结果
研究问题
- RQ1微调语言模型(如T0)是否能在无灾难性遗忘的情况下,在多样化语言生成任务上实现持续学习?
- RQ2T0的持续学习能力是否源于预训练、指令微调或模型规模?
- RQ3最小回放缓冲区(1%)在保持先前学习任务性能方面的有效性如何?
- RQ4模型能否泛化到训练期间未见过的组合指令?
- RQ5尽管未对这些任务进行回放,模型是否仍能保持在原始T0评估集上的强大零样本性能?
主要发现
- CT0在所有原始T0零样本评估数据集上均保持接近100%的性能,即使未对这些任务使用回放,表明其具有强大的知识保留能力。
- 仅使用1%的回放缓冲区,CT0在8个新语言生成任务上均取得高分,同时在70个数据集上保持对先前任务的性能。
- 模型能泛化到组合指令——例如,将共情与风格约束结合——显示出涌现的组合理解能力。
- 消融研究显示,持续学习的成功主要源于自监督预训练,而非指令微调或模型规模。
- 该模型能泛化到分布外任务(如新冠问答)而无需领域特定微调。
- 该方法在数据和计算上均高效,避免了完整微调,支持类似软件版本控制的增量模型更新。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。