[论文解读] Progress & Compress: A scalable framework for continual learning
本文提出Progress & Compress(P&C)框架,一种可扩展的持续学习方法,通过交替进行新任务学习(进展阶段)和将知识蒸馏到固定知识库中(压缩阶段),同时利用改进的弹性权重巩固(EWC)方法保护先前学习的技能。该方法在顺序图像分类和强化学习任务(如Atari游戏和3D导航)中表现出色,实现极低遗忘率且无参数增长,优于以往方法。
We introduce a conceptually simple and scalable framework for continual learning domains where tasks are learned sequentially. Our method is constant in the number of parameters and is designed to preserve performance on previously encountered tasks while accelerating learning progress on subsequent problems. This is achieved by training a network with two components: A knowledge base, capable of solving previously encountered problems, which is connected to an active column that is employed to efficiently learn the current task. After learning a new task, the active column is distilled into the knowledge base, taking care to protect any previously acquired skills. This cycle of active learning (progression) followed by consolidation (compression) requires no architecture growth, no access to or storing of previous data or tasks, and no task-specific parameters. We demonstrate the progress & compress approach on sequential classification of handwritten alphabets as well as two reinforcement learning domains: Atari games and 3D maze navigation.
研究动机与目标
- 解决持续学习中的灾难性遗忘问题,即模型在学习新任务时遗忘先前任务的知识。
- 通过利用先前学习任务的知识,加速新任务的学习,实现正向前向迁移。
- 通过避免参数增长、数据存储或任务特定参数,确保可扩展性,适用于不断增加的任务数量。
- 通过在学习新相关任务后提升旧任务的性能,支持后向迁移。
- 无需访问或存储先前数据,也无需任务标签或显式任务边界,适用于真实世界中的连续学习场景。
提出的方法
- 该框架使用两个固定大小的神经网络组件:知识库(KB),用于存储先前学习的技能;以及活跃列(AC),在进展阶段学习新任务。
- 在进展阶段,仅更新活跃列的参数,而知识库保持冻结;通过横向的、逐层的连接,允许知识库的特征被重用于活跃列,实现正向迁移。
- 在压缩阶段,通过知识蒸馏将活跃列的策略或预测结果更新到知识库中,并使用改进的EWC正则化方法防止灾难性遗忘。
- EWC正则化以在线方式应用,并引入衰减因子γ,以在遗忘与知识巩固之间取得平衡,保护在蒸馏过程中已学习的知识。
- 该过程在进展与压缩阶段之间交替进行,模拟人类的睡眠-清醒周期,实现记忆巩固。
- 该方法无需访问或存储先前数据,无需架构扩展,也无需任务特定参数,因此可扩展至大量任务。
实验结果
研究问题
- RQ1持续学习框架能否在不存储过去数据或网络参数增长的前提下,实现强正向迁移并最小化灾难性遗忘?
- RQ2与标准微调和基于正则化的传统方法相比,交替进行的进展-压缩周期在遗忘率和学习速度方面表现如何?
- RQ3该框架在多大程度上能支持后向迁移,即在学习新任务后提升旧任务的性能?
- RQ4与标准或离线EWC相比,在持续学习中使用带有衰减机制的在线EWC是否能提升性能与稳定性?
- RQ5该框架能否在不出现参数爆炸或性能下降的情况下,有效扩展至大量任务?
主要发现
- 在顺序MNIST和Omniglot任务中,P&C在五个任务上的平均准确率达到82.84%,优于EWC(75.96%)和在线EWC(79.15%),且参数量显著更少。
- 在Atari强化学习任务中,P&C在多个游戏中表现出显著性能提升,平均最终得分高于所有基线方法,仅略低于在线EWC,后者表现具有竞争力。
- 该方法展示了有效的正向迁移,即在学习新相关任务后,早期任务的性能得到提升,表明成功实现了后向迁移。
- 使用带有衰减因子γ = 0.99的在线EWC,使蒸馏过程中的遗忘得到可控管理,从而通过减弱EWC对知识库的约束,提升了整体性能。
- P&C保持了固定的模型大小(659K参数),远小于Progressive Networks(11.1M),且可扩展至大量任务,而无需任务特定参数或数据存储。
- 实证结果表明,在重新遇到任务时允许一定程度的遗忘(通过降低γ值实现)可提升最终性能,提示若未仔细调优,EWC的约束可能过于严格。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。