[论文解读] Dissecting Catastrophic Forgetting in Continual Learning by Deep Visualization
本文提出 Auto DeepVis,一种基于可视化的新方法,通过识别深度神经网络中最具可塑性(易遗忘)的组件,来剖析持续学习中的灾难性遗忘。通过利用预测差异分析和基于 IoU 的遗忘度量,该方法精准定位了关键层——特别是 ResNet-50 的 block 3 和 4——这些层经历了显著的激活变化;所提出的临界冻结技术仅冻结这些层,从而在旧任务和新任务上均取得更优性能,优于基线方法。
Interpreting the behaviors of Deep Neural Networks (usually considered as a black box) is critical especially when they are now being widely adopted over diverse aspects of human life. Taking the advancements from Explainable Artificial Intelligent, this paper proposes a novel technique called Auto DeepVis to dissect catastrophic forgetting in continual learning. A new method to deal with catastrophic forgetting named critical freezing is also introduced upon investigating the dilemma by Auto DeepVis. Experiments on a captioning model meticulously present how catastrophic forgetting happens, particularly showing which components are forgetting or changing. The effectiveness of our technique is then assessed; and more precisely, critical freezing claims the best performance on both previous and coming tasks over baselines, proving the capability of the investigation. Our techniques could not only be supplementary to existing solutions for completely eradicating catastrophic forgetting for life-long learning but also explainable.
研究动机与目标
- 理解灾难性遗忘在持续学习过程中于深度神经网络内部的作用机制。
- 开发一种工具,可在组件层面(如滤波器、模块)而非任务或模型层面可视化并定位遗忘。
- 识别在增量学习过程中对遗忘贡献最大的最具可塑性的网络层。
- 提出一种有针对性的、可解释的解决方案——临界冻结,仅冻结最脆弱的组件以减少遗忘。
- 在复杂视觉-语言任务(图像字幕生成)上验证该方法,使用 Split MS-COCO 数据集,避免使用过于简单的基准。
提出的方法
- Auto DeepVis 使用预测差异分析(PDA)识别支持或反驳预测的像素,从而可视化不同任务间特征的变化。
- 通过计算模型在学习新任务前后各层激活图之间的交并比(IoU),量化每一层的遗忘程度。
- 为每个卷积模块选择与真实分割掩码 IoU 最高的滤波器作为代表性滤波器,以降低计算成本,同时保持可解释性。
- 针对 ResNet-50,分析了 5 个残差块的遗忘情况,识别出 block 3 和 block 4 是最易受激活变化影响的区域。
- 提出临界冻结作为一项有针对性的正则化策略,仅冻结通过 Auto DeepVis 识别出的最具可塑性的层(如 block 3 和 block 4)。
- 通过逐个冻结解码器的各个组件(LSTM、嵌入层、全连接层),评估其在图像字幕生成与遗忘中的贡献。
实验结果
研究问题
- RQ1在深度神经网络中,哪些特定组件(滤波器、层、模块)在持续学习过程中最易导致灾难性遗忘?
- RQ2如何在组件层面而非模型或任务层面实现遗忘的可视化与量化?
- RQ3识别并选择性冻结最具可塑性的层,是否能提升在旧任务和新任务上的综合性能?
- RQ4在图像字幕生成模型中,不同解码器组件(如 LSTM、全连接层)对遗忘的贡献如何?
- RQ5可解释人工智能技术(如可视化)在多大程度上能改善持续学习算法的设计?
主要发现
- ResNet-50 的 block 3 和 block 4 忘记程度最严重,其激活图之间的 IoU 显著低于早期块。
- 在 block 3 处,$M_{24}$ 与 $M_{19}$ 之间的 IoU 出现急剧下降,表明此处是灾难性遗忘的主要发生位置。
- 临界冻结——即仅冻结最易遗忘的层——在旧任务和新任务上均取得最佳性能,优于基线冻结策略。
- 定性分析显示,临界冻结后预测结果几乎保持不变,仅出现少量误分类(如 美洲鹰 vs. 鹤),而两者均为鸟类。
- 在解码器中冻结 LSTM 层可获得最佳性能(BLEU1: 46.1,CIDEr: 12.8),而冻结全连接层则导致所有指标显著下降(BLEU1: 39.3,CIDEr: 4.2)。
- 在易遗忘层上应用知识蒸馏效果不佳,原因是教师与学生模型之间的差异随时间累积。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。