[论文解读] Lifelong Language Knowledge Distillation
本文提出终身语言知识蒸馏(L2KD),一种通过在每个新任务训练期间使用特定于任务的教师模型将知识蒸馏到主终身语言学习(LLL)模型中,以增强终身语言学习的方法。通过为每个任务使用一次性教师模型进行知识蒸馏,L2KD有效减轻了灾难性遗忘,在序列生成和文本分类任务中性能与多任务学习基线相差仅2%-3%,且内存开销极低。
It is challenging to perform lifelong language learning (LLL) on a stream of different tasks without any performance degradation comparing to the multi-task counterparts. To address this issue, we present Lifelong Language Knowledge Distillation (L2KD), a simple but efficient method that can be easily applied to existing LLL architectures in order to mitigate the degradation. Specifically, when the LLL model is trained on a new task, we assign a teacher model to first learn the new task, and pass the knowledge to the LLL model via knowledge distillation. Therefore, the LLL model can better adapt to the new task while keeping the previously learned knowledge. Experiments show that the proposed L2KD consistently improves previous state-of-the-art models, and the degradation comparing to multi-task models in LLL tasks is well mitigated for both sequence generation and text classification tasks.
研究动机与目标
- 解决在顺序学习多样化的自然语言处理(NLP)任务时,终身语言学习(LLL)中的灾难性遗忘问题。
- 在与多任务学习相比的性能退化方面,改进现有LLL方法(如LAMOL)的表现。
- 开发一种内存高效的方案,无需存储先前模型或增加模型容量。
- 探索在每个新任务中使用新型特定于任务的教师模型进行LLL中的知识蒸馏。
- 评估不同蒸馏策略(词级别和序列级别)在跨任务保留知识方面的有效性。
提出的方法
- 为每个新任务从零开始训练一个新的特定于任务的教师模型,作为知识来源。
- 主LLL模型(学生)通过在训练期间模仿教师的预测结果来执行知识蒸馏。
- 使用词级别(软标签之间的交叉熵损失)和序列级别(基于困惑度)的目标函数进行知识蒸馏。
- 蒸馏完成后立即丢弃教师模型,无需持久存储或额外模型容量。
- 将该方法集成到LAMOL框架中,该框架将NLP任务统一为问答和语言建模格式。
- 在问答和语言建模训练阶段均应用蒸馏,以提升泛化能力和知识保留。
实验结果
研究问题
- RQ1从新创建的、特定于任务的教师模型中进行知识蒸馏,是否能减轻终身语言学习中的灾难性遗忘?
- RQ2在性能和遗忘缓解方面,L2KD与多任务学习及先前的LLL方法相比表现如何?
- RQ3在LLL中,哪种蒸馏策略——词级别还是序列级别——能带来最佳性能和泛化能力?
- RQ4LLL模型是否完全复制了教师的行为,还是仍保有对未见样本的迁移能力?
- RQ5L2KD能否在不增加内存或模型容量的前提下高效应用?
主要发现
- L2KD在所有评估设置中均持续提升性能,将与多任务学习的差距缩小至最多2%-3%。
- 在序列生成任务中,使用词级别蒸馏的L2KD在Yelp数据集上达到99.2%的准确率,优于基线LAMOL模型。
- 在文本分类任务中,使用词级别蒸馏的L2KD将准确率从LAMOL的75.48%提升至77.11%,在教师模型正确回答的样本组(A组)中取得显著提升。
- LLL模型并未完全复制教师的行为,因为在教师模型错误回答的样本组(B组)中,性能保持稳定或略有提升,表明知识整合具有鲁棒性。
- 序列级别蒸馏(Seq-KD)的结果与词级别蒸馏相当,软标签序列蒸馏在TC基准上达到76.8%的准确率。
- 该方法仅需为教师模型增加极少的额外训练时间,且无需额外内存,因此在实际部署中具有可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。