[论文解读] Single-Net Continual Learning with Progressive Segmented Training (PST)
本文提出渐进式分段训练(PST),一种单网络持续学习方法,通过将模型参数划分为重要(冻结)和次要(保留)两组,并结合固定大小的缓存记忆进行回放,有效防止灾难性遗忘。PST在CIFAR-10和CIFAR-100上实现了最先进的单头准确率,同时将FLOPs显著降低——权重更新路径中的FLOPs降低超过24倍,使其在边缘设备部署中极具效率。
There is an increasing need of continual learning in dynamic systems, such as the self-driving vehicle, the surveillance drone, and the robotic system. Such a system requires learning from the data stream, training the model to preserve previous information and adapt to a new task, and generating a single-headed vector for future inference. Different from previous approaches with dynamic structures, this work focuses on a single network and model segmentation to prevent catastrophic forgetting. Leveraging the redundant capacity of a single network, model parameters for each task are separated into two groups: one important group which is frozen to preserve current knowledge, and secondary group to be saved (not pruned) for a future learning. A fixed-size memory containing a small amount of previously seen data is further adopted to assist the training. Without additional regularization, the simple yet effective approach of PST successfully incorporates multiple tasks and achieves the state-of-the-art accuracy in the single-head evaluation on CIFAR-10 and CIFAR-100 datasets. Moreover, the segmented training significantly improves computation efficiency in continual learning.
研究动机与目标
- 解决自适应边缘系统(如自动驾驶汽车和无人机)中持续学习的灾难性遗忘问题。
- 在无需事先识别任务的情况下,保持单头评估的高准确率,这是实际部署中的关键挑战。
- 降低持续学习中的计算成本,以实现在资源受限设备上的高效本地适应。
- 通过单一静态网络架构保留先前知识,避免动态结构扩展。
- 通过参数分段和记忆辅助训练实现高效性能,无需额外正则化。
提出的方法
- 将模型参数划分为两组:一组为关键参数(冻结以保护知识),另一组为次要参数(保留用于未来学习)。
- 使用重要性采样识别并冻结对先前任务最关键的参数。
- 维护一个固定大小的内存缓冲区,存储先前见过数据的小部分子集,用于持续回放训练。
- 应用记忆辅助平衡策略,通过动态调整记忆样本的贡献,确保学习稳定。
- 通过分段网络和记忆缓冲区对新任务进行渐进式训练,避免参数干扰。
- 利用单个网络的冗余容量,避免结构变化的同时保持性能。
实验结果
研究问题
- RQ1单个静态神经网络架构是否能在不进行动态结构扩展的情况下实现持续学习的最先进性能?
- RQ2参数分段结合记忆回放在单头评估中缓解灾难性遗忘的效率如何?
- RQ3渐进式分段在边缘设备上的持续学习中能将计算成本降低到何种程度?
- RQ4重要性采样、模型分段和记忆平衡对整体性能的相对贡献分别是什么?
- RQ5PST是否能在内存使用极少且FLOP开销低的资源受限环境中维持高准确率?
主要发现
- PST在CIFAR-10和CIFAR-100上,针对5、10和20个增量任务,均实现了最先进的单头准确率。
- 若移除重要性采样或模型分段,准确率显著下降0.32–0.45个百分点,证明二者具有关键作用。
- 记忆辅助平衡策略贡献较小但仍有提升效果,在不同内存预算下准确率提升0.06–0.11个百分点。
- 与iCaRL等正则化方法相比,PST在权重更新路径中将FLOPs降低超过24倍,尤其有利于边缘设备部署。
- 即使内存有限,该方法仍能保持高准确率,但性能增益在内存达到一定规模后趋于饱和。
- 分段训练方法可实现更快的训练速度并降低延迟,尤其得益于权重更新路径中操作的减少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。