Skip to main content
QUICK REVIEW

[论文解读] Learning with Long-term Remembering: Following the Lead of Mixed Stochastic Gradient.

Yunhui Guo, Mingrui Liu|arXiv (Cornell University)|Sep 25, 2019
Domain Adaptation and Few-Shot Learning参考文献 46被引用 6
一句话总结

本文提出 MEGA,一种新颖的终身学习算法,通过平衡当前任务的梯度与过去任务的小型情景记忆梯度,缓解深度神经网络中的灾难性遗忘。通过采用混合随机梯度方法整合旧任务梯度,MEGA 在四个标准基准上将误差降低高达 18%,显著优于先前方法。

ABSTRACT

Current deep neural networks can achieve remarkable performance on a single task. However, when the deep neural network is continually trained on a sequence of tasks, it seems to gradually forget the previous learned knowledge. This phenomenon is referred to as catastrophic forgetting and motivates the field called lifelong learning. The central question in lifelong learning is how to enable deep neural networks to maintain performance on old tasks while learning a new this http URL this paper, we introduce a novel and effective lifelong learning algorithm, calledMixEd stochastic GrAdient (MEGA), which allows deep neural networks to ac-quire the ability of retaining performance on old tasks while learning new tasks.MEGA modulates the balance between old tasks and the new task by integrating the current gradient with the gradient computed on a small reference episodic memory. Extensive experimental results show that the proposed MEGA algorithm significantly advances the state-of-the-art on all four commonly used life-long learning benchmarks, reducing the error by up to 18%.

研究动机与目标

  • 解决持续深度学习中灾难性遗忘的挑战,即模型在学习新任务时性能在先前学习的任务上下降的问题。
  • 开发一种方法,使深度神经网络在学习新任务的同时保持对旧任务的性能。
  • 通过有效的梯度调制机制,提升终身学习场景下的泛化能力和稳定性。
  • 在标准终身学习基准上实现最先进性能,且计算开销极低。

提出的方法

  • 提出 MEGA,一种混合随机梯度算法,将当前任务的梯度与基于过去数据小样本情景记忆计算出的梯度相结合。
  • 使用当前任务梯度与情景记忆中计算出的参考梯度的加权组合来更新模型参数。
  • 维护一个小型且具代表性的过去数据样本情景记忆,用于持续正则化计算参考梯度。
  • 通过可学习或固定加权方案,动态平衡旧任务与新任务梯度的影响,以稳定学习过程。
  • 在每个训练步骤中应用梯度调制,以保留先前任务的知识,而无需重放所有过去数据。
  • 利用随机优化原理,确保可扩展性并兼容标准深度学习框架。

实验结果

研究问题

  • RQ1是否一种基于梯度的方法能有效减少灾难性遗忘,而无需完整重放过去数据?
  • RQ2将小型情景记忆中的梯度整合进来,如何提升在旧任务和新任务上的性能?
  • RQ3MEGA 在标准基准上相较于现有终身学习方法的性能提升程度如何?
  • RQ4在稳定持续学习中,当前任务梯度与基于记忆的梯度之间最优平衡为何种比例?
  • RQ5MEGA 是否在多样化且顺序排列的任务序列中保持强大的泛化性能?

主要发现

  • MEGA 在所有四个常用终身学习基准上均达到最先进性能,一致优于现有方法。
  • 与先前方法相比,该方法将误差降低高达 18%,凸显其在缓解灾难性遗忘方面的有效性。
  • MEGA 在学习新任务的同时保持对先前学习任务的高性能,表明其具备强大的知识保留能力。
  • 情景记忆梯度的整合使顺序任务上的学习动态更加稳定且准确。
  • 该方法在极低内存开销下实现显著性能提升,因其依赖小型参考记忆而非完整重放。
  • 结果证实,利用情景记忆进行梯度调制是深度神经网络终身学习中一种可扩展且有效的策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。