[论文解读] IF2Net: Innately Forgetting-Free Networks for Continual Learning
IF2Net 提出了一种新颖的持续学习框架,通过冻结特定任务的权重,并结合基于随机化的表征修正与基于正交化的输出自适应,实现了内在的遗忘-free学习。该方法使单一网络能够无限制地学习新任务而不会遗忘,以极低的内存和计算成本,在稳定性和泛化能力方面优于现有方法。
Continual learning can incrementally absorb new concepts without interfering with previously learned knowledge. Motivated by the characteristics of neural networks, in which information is stored in weights on connections, we investigated how to design an Innately Forgetting-Free Network (IF2Net) for continual learning context. This study proposed a straightforward yet effective learning paradigm by ingeniously keeping the weights relative to each seen task untouched before and after learning a new task. We first presented the novel representation-level learning on task sequences with random weights. This technique refers to tweaking the drifted representations caused by randomization back to their separate task-optimal working states, but the involved weights are frozen and reused (opposite to well-known layer-wise updates of weights). Then, sequential decision-making without forgetting can be achieved by projecting the output weight updates into the parsimonious orthogonal space, making the adaptations not disturb old knowledge while maintaining model plasticity. IF2Net allows a single network to inherently learn unlimited mapping rules without telling task identities at test time by integrating the respective strengths of randomization and orthogonalization. We validated the effectiveness of our approach in the extensive theoretical analysis and empirical study.
研究动机与目标
- 为解决持续学习中的灾难性遗忘问题,设计一种网络,使其在无需外部机制(如回放或正则化)的情况下,内在地保留先前学习的知识。
- 克服现有方法依赖权重更新、样本缓冲区或动态架构扩展的局限性。
- 开发一种简单、可扩展且内存高效的框架,在保持模型可塑性的同时,确保在无限任务序列中知识的保留。
- 从理论和实证上验证一种学习范式:仅更新输出层权重,而隐藏层权重始终保持冻结。
提出的方法
- 引入基于随机权重的表征级学习,以修正由随机化引起的表征漂移,将表征恢复至任务最优状态,而无需更新原始权重。
- 采用简洁的正交空间投影进行输出权重更新,确保新适应过程不干扰先前学习的知识。
- 在初始任务学习后冻结所有隐藏层权重,通过避免参数覆盖来防止灾难性遗忘。
- 使用解析初始化以提升泛化能力和稳定性,替代表征修正阶段的随机初始化。
- 仅对最终输出层应用正交化,以在保持旧知识的同时维持决策的可塑性。
- 避免通过冻结层进行反向传播,降低计算成本,实现高效的顺序训练。
实验结果
研究问题
- RQ1能否设计一种神经网络,通过在整个持续学习过程中冻结特定任务的权重,从根本上避免遗忘?
- RQ2如何在不更新原始权重的情况下,修正由随机化引起的表征漂移?
- RQ3仅对部分层进行正交化对持续学习中的泛化能力和遗忘有何影响?
- RQ4单个网络能否在无需显式记忆或架构扩展的情况下学习无限数量的任务?
- RQ5与现有持续学习方法相比,随机化与正交化结合在稳定性和泛化能力方面表现如何?
主要发现
- IF2Net 在 FashionMNIST-10/5 上实现了 95.26% ± 0.0088 的准确率,仅正交化一个输出层,优于其他配置和基线方法。
- 该方法将后向迁移(BWT)降低至 -0.0071 ± 0.0060,前向迁移(FWT)降低至 -0.0289 ± 0.0173,表明负干扰极小且具有强稳定性。
- 通过 Rademacher 复杂度衡量的泛化界误差,IF2Net 在采用解析初始化(情形 e)时增加最慢,证明其具备更优的泛化能力。
- GPU 显存使用量降至 829 MB,仅正交化一个层,相比正交化更多层的配置展现出更高的效率。
- 随机初始化(情形 d)的准确率(90.90% ± 0.0201)低于解析初始化(95.26% ± 0.0088),证明解析初始化在表征修正中的优势。
- 理论分析证实了表征近似与无遗忘学习在决策过程中的收敛性,验证了该方法的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。