QUICK REVIEW
[论文解读] Localizing Catastrophic Forgetting in Neural Networks
Felix Wiewel, Bin Yang|arXiv (Cornell University)|Jun 6, 2019
Domain Adaptation and Few-Shot Learning参考文献 14被引用 5
一句话总结
本文提出一种参数级别的定位方法,用于量化神经网络中各个权重在持续学习过程中对灾难性遗忘的贡献。通过基于路径积分的方法,揭示了最后几层全连接层的权重对遗忘的贡献最大,尤其是在增量类学习中,为遗忘机制提供了新的见解,并验证了先前关于在具有挑战性的持续学习场景中梯度动态的观察结果。
ABSTRACT
Artificial neural networks (ANNs) suffer from catastrophic forgetting when trained on a sequence of tasks. While this phenomenon was studied in the past, there is only very limited recent research on this phenomenon. We propose a method for determining the contribution of individual parameters in an ANN to catastrophic forgetting. The method is used to analyze an ANNs response to three different continual learning scenarios.
研究动机与目标
- 为解决人工神经网络中灾难性遗忘内部机制研究的不足。
- 开发一种量化单个参数对遗忘贡献的方法,超越准确率或损失等标量指标。
- 分析不同持续学习场景——增量任务学习(ITL)、增量领域学习(IDL)和增量类学习(ICL)——对参数级别遗忘的影响。
- 提供对驱动灾难性遗忘的网络组件的局部化洞察,从而支持更明智的缓解策略设计。
提出的方法
- 该方法采用路径积分方法,计算每个参数在持续学习过程中损失变化的贡献。
- 通过沿训练轨迹对损失关于该参数的梯度进行积分,定义每个参数的损失贡献度量。
- 该方法通过测量每个权重或偏置对先前学习任务损失增加的贡献,实现对遗忘的逐参数归因。
- 该方法在三种持续学习场景中应用:ITL、IDL 和 ICL,使用标准卷积神经网络架构在基准数据集上进行实验。
- 通过 10 次随机初始化的结果聚合,确保统计稳健性,并报告均值与标准差。
- 分析涵盖权重矩阵和偏置向量,并通过逐神经元/滤波器的平均,识别层级别的模式。
实验结果
研究问题
- RQ1在持续学习过程中,神经网络中的哪些单个参数对灾难性遗忘的贡献最大?
- RQ2不同持续学习场景(ITL、IDL、ICL)中,参数对遗忘的贡献有何差异?
- RQ3最后一层参数是否始终表现出更高的遗忘贡献?如果是,原因是什么?
- RQ4参数级别的定位能否揭示解释不同场景间遗忘严重程度差异的模式?
主要发现
- 最后一层全连接权重对灾难性遗忘的贡献最大,尤其在增量类学习(ICL)中,其损失的绝对变化最高。
- 在 ICL 中,神经元/滤波器的贡献从第一层全连接层到最后一层全连接层逐渐增加,与 ITL 和 IDL 中更均匀的分布形成对比。
- 卷积层对遗忘的贡献小于全连接层,第二卷积层甚至在所有场景中平均表现出损失减少。
- ICL 中损失贡献的方差最高,特别是在最后几层,表明该场景下具有更高的不稳定性与敏感性。
- 该方法支持先前观察:ICL 比 IDL 导致更多遗忘,原因在于最终层梯度幅度过大,现在该现象被定位到特定参数。
- 与权重矩阵相比,偏置向量对遗忘的贡献可忽略不计,表明权重更新是灾难性遗忘的主要驱动因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。