Skip to main content
QUICK REVIEW

[论文解读] Continual Deep Learning by Functional Regularisation of Memorable Past

Pingbo Pan, Siddharth Swaroop|arXiv (Cornell University)|Apr 29, 2020
Domain Adaptation and Few-Shot Learning参考文献 31被引用 32
一句话总结

FROMP 引入一种用于连续学习的功能性正则化方法,通过对一个通过高斯过程对DNNs进行建模而筛选的“难忘”过去样本来正则化网络输出,在标准基准测试上达到最先进的结果。

ABSTRACT

Continually learning new skills is important for intelligent systems, yet standard deep learning methods suffer from catastrophic forgetting of the past. Recent works address this with weight regularisation. Functional regularisation, although computationally expensive, is expected to perform better, but rarely does so in practice. In this paper, we fix this issue by using a new functional-regularisation approach that utilises a few memorable past examples crucial to avoid forgetting. By using a Gaussian Process formulation of deep networks, our approach enables training in weight-space while identifying both the memorable past and a functional prior. Our method achieves state-of-the-art performance on standard benchmarks and opens a new direction for life-long learning where regularisation and memory-based methods are naturally combined.

研究动机与目标

  • 通过将正则化重点放在输出层,而不仅仅是权重正则化,来解决持续学习中的灾难性遗忘。
  • 引入一个基于高斯过程的功能先验,该先验来自于DNN,用以对下一个任务进行正则化。
  • 识别一小组信息丰富且难忘的过去样本,以在保持性能的同时最小化计算开销。
  • 在权重空间中训练,使用一个利用难忘过去样本之间相关性的功能先验。

提出的方法

  • 将深度网络转换为高斯过程(DNN2GP),以获得网络输出上的功能先验。
  • 通过使用每个样本输出的 Hessian/二阶导数(Lambda)作为相关性量度,对数据点进行排序,从而识别难忘的过去样本。
  • 通过最小化一个损失,将标准任务损失与来自记忆过去输出的 GP 后验推导出的封闭形式功能正则化项相结合,对当前任务进行正则化。
  • 用可管理的近似来近似功能先验(均场、分块对角核、确定性优化),以实现使用 Adam 的可扩展训练。
  • 构建一个类似带权重的功能正则化器的目标,鼓励难忘过去的输出保持接近过去的预测,同时保持计算效率。

实验结果

研究问题

  • RQ1在持续学习任务中,基于一小组难忘过去样本的功能正则化是否能超越传统的权重正则化?
  • RQ2相比现有的功能正则化方法,利用基于高斯过程的网络输出功能先验是否能提高对过去任务的保留?
  • RQ3对难忘过去输入的自动选择如何影响持续学习中的性能与计算成本?
  • RQ4在使用可扩展近似实现 FROMP 时,实际的计算权衡是什么?

主要发现

  • FROMP 方法在标准持续学习基准上实现了最先进的性能(如摘要所述)。
  • 通过与损失 Hessian 相关的相关性量度选出的难忘过去样本,通常位于决策边界附近,对防止遗忘至关重要。
  • 基于 GP 的功能先验利用难忘样本之间的相关性来正则化输出,而不需要保留全部数据,从而实现权重空间中的训练。
  • 与以往的功能正则化方法相比,FROMP 通过引入一个关于难忘过去的核并将均值正则化为过去的预测来提升一致性和性能。
  • 该方法通过近似如分块对角核和均场假设,使得在使用 Adam 的同时具有适度的计算开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。