[论文解读] Dark Experience for General Continual Learning: a Strong, Simple Baseline
本文提出 Dark Experience Replay (DER) 与 DER++,这两个简单的基于重放的基线方法,它们从优化轨迹中存储 logits,并结合知识蒸馏以在通用持续学习(General Continual Learning)中缓解遗忘;DER/DER++ 在标准 CL 基准以及一个新的 MNIST-360 设置上超过了许多方法。
Continual Learning has inspired a plethora of approaches and evaluation settings; however, the majority of them overlooks the properties of a practical scenario, where the data stream cannot be shaped as a sequence of tasks and offline training is not viable. We work towards General Continual Learning (GCL), where task boundaries blur and the domain and class distributions shift either gradually or suddenly. We address it through mixing rehearsal with knowledge distillation and regularization; our simple baseline, Dark Experience Replay, matches the network's logits sampled throughout the optimization trajectory, thus promoting consistency with its past. By conducting an extensive analysis on both standard benchmarks and a novel GCL evaluation setting (MNIST-360), we show that such a seemingly simple baseline outperforms consolidated approaches and leverages limited resources. We further explore the generalization capabilities of our objective, showing its regularization being beneficial beyond mere performance.
研究动机与目标
- 激励并形式化“任务边界模糊、在线训练占主导”的通用持续学习(General Continual Learning)。
- 提出一个简单的基线,将回顾(rehearsal)与知识蒸馏结合起来,通过回放优化轨迹中的 logits 实现。
- 演示 DER 和 DER++ 在 GCL 设置下达到最先进的性能,并分析它们的正则化与校准特性。
提出的方法
- 将 DER 定义为最小化当前任务损失 plus 一个 alpha 加权的 KL/对数概率距离项,目标是在当前 logits 与来自水库缓冲区的存储过去 logits 之间。
- 在回放缓冲区中存储 logits(z),而非真实标签,以蒸馏过去知识。
- 使用水库采样从数据流中维护一个任务无关的记忆缓冲区。
- DER++ 增加了第二个正则化项,也通过一个 beta 加权的损失分量使过去数据与真实标签的引导对齐。
- 论证匹配 logits 近似于匹配预 softmax 响应,将 KL 散度与 logits 的欧氏差异联系起来。
- 提供 DER 与 DER++ 的算法及其实践训练步骤。
实验结果
研究问题
- RQ1一个简单的基于 logits 的回放基线(DER)是否能在三大主要 CL 设置(Task-IL、Class-IL、Domain-IL)下在没有任务边界的情况下泛化?
- RQ2就准确性、校准和训练效率而言,DER 与基于正则化的方法及其他基于回放的方法相比如何?
- RQ3基于水库的、任务无关的记忆缓冲区是否能有效支持在没有测试时任务标识符的情况下的持续学习?
- RQ4通过在回放中引入真实标签引导,DER++ 是否带来额外的好处?
- RQ5在结合突发与渐进分布漂移的新的 GCL 基准 MNIST-360 上,DER/DER++ 的行为是怎样的?
主要发现
- DER 与 DER++ 在多个 CL 基准上达到最先进的性能,且常常超过回放基线与非回放基线。
- DER 收敛到更平的极小值,并比 ER 及其他基线具有更好的校准性,表明鲁棒性和可解释性提升。
- 使用优化轨迹中的 logits(而非任务边界输出)结合水库采样,提升内存的有用性和跨任务的一致性。
- DER/DER++ 在 Domain-IL 和 Class-IL 设置中显示出强劲表现,那里任务边界缺失或不具区分性。
- 在提出的方法中,DER++ 通常提供最佳结果,尤其是在缓冲区大小受限时。
- MNIST-360 证明了 DER/DER++ 在同时存在突发和渐进分布漂移的新的 GCL 体系下有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。