Skip to main content
QUICK REVIEW

[论文解读] Generalisation Guarantees for Continual Learning with Orthogonal Gradient Descent

Mehdi Bennani, Thang Doan|arXiv (Cornell University)|Jun 21, 2020
Domain Adaptation and Few-Shot Learning被引用 13
一句话总结

该论文首次在神经正切核(NTK)框架下建立了随机梯度下降(SGD)和正交梯度下降(OGD)在持续学习中的泛化边界。论文证明了OGD在任意任务下对灾难性遗忘具有鲁棒性,并推导出依赖于NTK空间中任务相似性的泛化边界,同时指出了在非过参数化设置下NTK变化带来的局限性。

ABSTRACT

In Continual Learning settings, deep neural networks are prone to Catastrophic Forgetting. Orthogonal Gradient Descent was proposed to tackle the challenge. However, no theoretical guarantees have been proven yet. We present a theoretical framework to study Continual Learning algorithms in the Neural Tangent Kernel regime. This framework comprises closed form expression of the model through tasks and proxies for Transfer Learning, generalisation and tasks similarity. In this framework, we prove that OGD is robust to Catastrophic Forgetting then derive the first generalisation bound for SGD and OGD for Continual Learning. Finally, we study the limits of this framework in practice for OGD and highlight the importance of the Neural Tangent Kernel variation for Continual Learning with OGD.

研究动机与目标

  • 为在神经正切核(NTK)框架下的持续学习算法建立理论分析框架。
  • 证明在无限记忆条件下,正交梯度下降(OGD)对任意数量任务的灾难性遗忘具有鲁棒性。
  • 推导出SGD和OGD在持续学习中的首个泛化边界,揭示其对NTK空间中任务相似性的依赖性。
  • 研究基于NTK的框架在实际应用中的局限性,特别是当NTK不恒定时的情况。

提出的方法

  • 将持续学习建模为NTK框架下的递归核回归,通过任务实现模型更新的闭式表达。
  • 在NTK框架内引入迁移学习、泛化、任务相似性和课程学习的代理变量。
  • 通过核对齐和梯度正交性,证明OGD在无限记忆下能保持对先前任务的性能。
  • 推导出SGD和OGD的泛化边界,其依赖于NTK空间中任务表征的内积。
  • 分析在实际非过参数化设置下NTK变化的影响,表明其会降低OGD对遗忘的鲁棒性。
  • 采用过参数化网络动力学的理论工具,包括NTK和梯度下降的线性收敛性质。

实验结果

研究问题

  • RQ1我们能否为OGD在持续学习中对灾难性遗忘的鲁棒性提供理论保证?
  • RQ2NTK空间中的任务相似性如何影响SGD和OGD在持续学习中的泛化性能?
  • RQ3SGD和OGD在持续学习中的首个泛化边界是什么?其结构如何?
  • RQ4NTK的变化如何影响OGD在实际非无限宽度设置下的性能?
  • RQ5当训练过程中核函数不恒定时,基于NTK的框架在多大程度上仍保持有效性?

主要发现

  • 在NTK框架下,OGD被证明在无限记忆条件下对任意数量任务的灾难性遗忘具有鲁棒性。
  • 首次推导出SGD和OGD在持续学习中的泛化边界,表明泛化性能依赖于通过NTK度量的任务相似性。
  • 泛化边界表明,当先前任务在NTK特征空间中更相似时,未来任务的性能更好。
  • 在非过参数化设置中,神经正切核(NTK)的变化会负面影响OGD对遗忘的鲁棒性,限制了该框架的实际适用性。
  • 实验结果表明,OGD+在平均准确率和反向迁移方面优于OGD和Stable SGD,但在Split CIFAR100和CUB200上性能下降,原因在于过参数化。
  • 在Rotated MNIST上,OGD+在平均准确率和反向迁移方面优于OGD,但在正向迁移方面被Stable SGD超越。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。