[论文解读] REMIND Your Neural Network to Prevent Catastrophic Forgetting
REMIND 是一种受大脑启发的在线学习框架,通过重放压缩的、量化后的特征表示而非原始像素,防止神经网络发生灾难性遗忘。利用产品量化(Product Quantization)实现高效的内存索引,REMIND 在流式学习场景下于 ImageNet 上实现了最先进性能,准确率比现有方法高出 21.9%,且训练时间少于 12 小时——展现出对流式视觉问答等任务的强鲁棒性和泛化能力。
People learn throughout life. However, incrementally updating conventional neural networks leads to catastrophic forgetting. A common remedy is replay, which is inspired by how the brain consolidates memory. Replay involves fine-tuning a network on a mixture of new and old instances. While there is neuroscientific evidence that the brain replays compressed memories, existing methods for convolutional networks replay raw images. Here, we propose REMIND, a brain-inspired approach that enables efficient replay with compressed representations. REMIND is trained in an online manner, meaning it learns one example at a time, which is closer to how humans learn. Under the same constraints, REMIND outperforms other methods for incremental class learning on the ImageNet ILSVRC-2012 dataset. We probe REMIND's robustness to data ordering schemes known to induce catastrophic forgetting. We demonstrate REMIND's generality by pioneering online learning for Visual Question Answering (VQA).
研究动机与目标
- 为解决持续在线学习中的灾难性遗忘问题,即神经网络在非独立同分布(non-iid)数据流上训练时覆盖先前知识的问题。
- 开发一种受大脑海马体索引与记忆重放机制启发的生物上合理的学习方法。
- 在内存受限条件下,通过使用压缩表示而非原始图像重放,实现高效在线学习。
- 将该方法扩展至新任务,如流式视觉问答(VQA),此前在在线学习中尚未探索。
- 为流式 VQA 建立新的基准和评估协议,并在 CLEVR 和 TDIUC 数据集上展示优异性能。
提出的方法
- REMIND 使用产品量化(PQ)压缩并存储隐藏特征图(例如来自 ResNet-18 的特征),以供后续重放,实现高效的内存索引。
- 模型通过逐个样本在线学习的方式更新网络,模拟人类的流式学习过程。
- 训练期间,REMIND 在当前数据与从过往经验中随机采样的压缩特征表示的混合数据上微调网络。
- 重放缓冲区通过随机替换方式更新,保持固定大小的压缩特征内存,且计算开销极低。
- 在 VQA 任务中,REMIND 通过重放压缩的视觉-语言特征,保留了多模态表示在流式输入中的稳定性。
- 该方法在推理阶段不依赖任务标签,因此对导致遗忘的真实世界数据排序方式具有鲁棒性。
实验结果
研究问题
- RQ1与原始像素重放相比,重放压缩的高层级特征表示是否能更有效地缓解在线学习中的灾难性遗忘?
- RQ2在严格的内存与计算约束下,REMIND 在 ImageNet 上相较于批量学习与流式基线方法表现如何?
- RQ3REMIND 是否能在不修改架构的前提下泛化至多模态任务(如流式视觉问答,VQA)?
- RQ4当数据按诱发灾难性遗忘的方式排序(如类别增量或实例增量)时,REMIND 是否仍保持鲁棒性?
- RQ5REMIND 是否能在少于 12 小时内实现接近离线全批量训练的性能,而无需像批量方法那样耗时 65 小时以上?
主要发现
- 在流式设置下,REMIND 在 ImageNet 上实现了 99.5% 的 top-5 准确率,优于最佳流式基线方法 21.9%,且仅比最佳批量模型低 1.9%。
- 在 CORe50 数据集上,即使未提供任务标签,REMIND 也优于基于正则化的方法(如 EWC、MAS 和 A-GEM),展现出对遗忘的强鲁棒性。
- 在 ImageNet 上,REMIND 将训练时间缩短至 12 小时以内,而 BiC(一种最先进批量方法)则需 65 小时。
- 在流式 VQA 中,REMIND 在 CLEVR 和 TDIUC 数据集上均取得优异性能,建立了新基准,并展示了超越图像分类任务的泛化能力。
- REMIND 在不同数据排序方案(包括类别有序与实例有序流)下性能保持稳定,表明其对诱发遗忘序列具有强韧性。
- 通过 PQ 压缩表示的使用,使 REMIND 在相同内存预算下能够存储远多于依赖原始像素重放方法的经验。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。