[论文解读] Learning to Prompt for Continual Learning
该论文提出L2P,一种新颖的持续学习方法,通过可学习提示池动态指导冻结的预训练模型完成顺序任务,无需在推理时使用回放缓冲区或任务身份。L2P通过基于查询的提示选择机制,联合优化任务无关与任务特定知识,在多个基准测试中达到最先进性能,包括在具有挑战性的无任务设定场景中。
The mainstream paradigm behind continual learning has been to adapt the model parameters to non-stationary data distributions, where catastrophic forgetting is the central challenge. Typical methods rely on a rehearsal buffer or known task identity at test time to retrieve learned knowledge and address forgetting, while this work presents a new paradigm for continual learning that aims to train a more succinct memory system without accessing task identity at test time. Our method learns to dynamically prompt (L2P) a pre-trained model to learn tasks sequentially under different task transitions. In our proposed framework, prompts are small learnable parameters, which are maintained in a memory space. The objective is to optimize prompts to instruct the model prediction and explicitly manage task-invariant and task-specific knowledge while maintaining model plasticity. We conduct comprehensive experiments under popular image classification benchmarks with different challenging continual learning settings, where L2P consistently outperforms prior state-of-the-art methods. Surprisingly, L2P achieves competitive results against rehearsal-based methods even without a rehearsal buffer and is directly applicable to challenging task-agnostic continual learning. Source code is available at https://github.com/google-research/l2p.
研究动机与目标
- 解决持续学习中的灾难性遗忘问题,且不依赖推理时的回放缓冲区或已知任务身份。
- 开发一种简洁、智能的情景记忆系统,以比数据缓冲更高效地存储知识。
- 实现在顺序学习中有效知识迁移,并最小化不同任务之间的干扰。
- 设计一种基于提示的框架,使单一冻结主干网络能够通过动态、实例级提示选择适应新任务。
- 在任务无关的持续学习中证明方法的有效性,即推理时任务边界未知。
提出的方法
- L2P维护一个可学习参数的共享提示池,其中每个提示编码任务特定或共享知识。
- 通过基于输入特征的查询机制,利用可学习键动态选择提示子集以引导检索。
- 提示池与监督损失联合优化,使模型能够同时学习任务无关与任务特定知识。
- 提示被附加到输入嵌入之前,作为条件指令以引导冻结主干网络的预测。
- 采用多样化提示选择策略,通过限制跨任务提示共享,减少不相关任务之间的干扰。
- 该方法采用键值记忆结构,其中键为可学习参数,用于根据输入特征检索相关提示。
实验结果
研究问题
- RQ1基于提示的记忆系统能否在保持性能的前提下替代持续学习中的传统回放缓冲区?
- RQ2在推理时无需任务身份的情况下,能否通过动态、实例级提示选择有效引导单一冻结模型?
- RQ3如何设计提示以同时编码任务无关与任务特定知识,从而减少灾难性遗忘?
- RQ4基于提示的学习在任务无关持续学习中能多大程度上泛化,即推理时任务边界未知?
- RQ5提示池大小、提示长度和选择大小等超参数在多大程度上影响模型性能与知识保留?
主要发现
- L2P在标准类别增量与领域增量基准测试中,包括无回放缓冲区的设置下,优于所有先前的最先进方法。
- 在任务无关设置中,L2P即使无回放缓冲区也实现了最佳性能,超越依赖缓冲区或任务身份依赖机制的方法。
- 移除提示池并仅使用单个提示会导致性能显著下降,证实了共享多提示记忆系统的重要性。
- 提示检索机制中的可学习键至关重要——用平均提示替代可学习键会降低性能,表明其在解耦查询与提示学习中的作用。
- 多样化提示选择策略在如5-datasets等多样化数据集上提升了性能,通过减少不相关任务间的干扰。
- 最优的提示长度与池大小至关重要:提示长度过短会损害性能,而更大的池大小能提升结果,尤其在任务多样性较高的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。