Skip to main content
QUICK REVIEW

[论文解读] Memory Efficient Continual Learning with Transformers

Beyza Ermiş, Giovanni Zappella|arXiv (Cornell University)|Mar 9, 2022
Domain Adaptation and Few-Shot Learning被引用 12
一句话总结

本文提出自适应适配器蒸馏(ADA),一种针对预训练Transformer模型的内存高效持续学习方法,结合适配器模块与知识蒸馏,以防止灾难性遗忘。ADA在参数量固定的情况下,于连续任务中保持高准确率,推理速度优于最先进方法,且参数量相比AdapterFusion减少一个数量级,同时在文本与视觉任务上实现相当或更优的性能。

ABSTRACT

In many real-world scenarios, data to train machine learning models becomes available over time. Unfortunately, these models struggle to continually learn new concepts without forgetting what has been learnt in the past. This phenomenon is known as catastrophic forgetting and it is difficult to prevent due to practical constraints. For instance, the amount of data that can be stored or the computational resources that can be used might be limited. Moreover, applications increasingly rely on large pre-trained neural networks, such as pre-trained Transformers, since the resources or data might not be available in sufficiently large quantities to practitioners to train the model from scratch. In this paper, we devise a method to incrementally train a model on a sequence of tasks using pre-trained Transformers and extending them with Adapters. Different than the existing approaches, our method is able to scale to a large number of tasks without significant overhead and allows sharing information across tasks. On both image and text classification tasks, we empirically demonstrate that our method maintains a good predictive performance without retraining the model or increasing the number of model parameters over time. The resulting model is also significantly faster at inference time compared to Adapter-based state-of-the-art methods.

研究动机与目标

  • 解决持续学习场景中模型随时间学习新任务时遗忘先前知识的灾难性遗忘问题。
  • 在实际应用中实现高效、可扩展的持续学习,适用于内存与计算资源有限的预训练Transformer模型。
  • 在不增加模型大小或从头再训练的情况下,保持对不断增长任务数量的高预测性能。
  • 相比现有基于适配器的持续学习方法,减少推理时间与内存占用。
  • 在多种预训练模型上,于文本与视觉分类任务中验证该方法的有效性。

提出的方法

  • 提出自适应适配器蒸馏(ADA)方法,结合适配器模块与知识蒸馏,以保留先前任务的知识。
  • 使用固定大小的适配器模块池,动态选择并微调新任务的适配器,避免随任务数量增加而参数增长。
  • 采用蒸馏损失,将先前任务特定适配器的知识迁移至当前适配器,最小化遗忘。
  • 应用两种蒸馏策略——LEEP与TransRate——分别基于特征与logit层级的蒸馏,以提升知识迁移效果。
  • 支持二分类与多分类场景的持续学习,评估基准涵盖文本(Arxiv、Reuters)与视觉(CIFAR100、MiniImageNet)任务。
  • 将基于适配器的微调方法扩展至视觉Transformer(DeiT、ViT),证明其在不同模型架构间的泛化能力。

实验结果

研究问题

  • RQ1基于适配器与蒸馏的持续学习方法是否能在不增加模型参数的情况下,于大量连续任务中保持高性能?
  • RQ2与最先进基于适配器的方法相比,所提出的ADA方法在内存效率、推理速度与准确率方面表现如何?
  • RQ3ADA中的知识蒸馏在文本与视觉持续学习任务中,能在多大程度上减轻灾难性遗忘?
  • RQ4ADA是否在少样本设置下实现与现有方法相当或更优的正向与负向迁移收益?
  • RQ5ADA是否可有效应用于视觉Transformer模型?其在不同预训练视觉模型上是否保持性能稳定?

主要发现

  • ADA在性能上可与独立适配器相媲美,尤其在少样本设置下表现更优:Arxiv任务仅使用100个标注样本,Reuters任务仅使用160个标注样本时即超越独立适配器。
  • 在Arxiv任务中使用200个标注样本时,ADA-K=4配合TransRate策略,性能与独立适配器相当,但参数量显著减少。
  • 与AdapterFusion相比,ADA将参数量减少一个数量级,且无论任务数量多少,参数总数保持不变。
  • 由于采用固定大小的适配器池与高效蒸馏机制,ADA的推理速度显著快于现有基于适配器的最先进方法。
  • 在使用DeiT-B的视觉任务中,ADA实现极低的负向与正向迁移误差,BWT接近零,正向迁移为正,表明其具备优异的知识保留与迁移能力。
  • 该方法具有良好的模型泛化能力:在DistilBERT、RoBERTa、ViT/DeiT等模型上均观察到相似的性能趋势,证实其在不同架构间的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。