Skip to main content
QUICK REVIEW

[论文解读] Routing Networks with Co-training for Continual Learning

Mark Collier, Efi Kokiopoulou|arXiv (Cornell University)|Sep 9, 2020
Domain Adaptation and Few-Shot Learning参考文献 24被引用 9
一句话总结

本文提出一种结合共训练的稀疏路由网络用于持续学习,通过任务特定的专家路由机制最小化灾难性遗忘。通过将相似任务路由至共享专家、不同任务路由至独立专家,该方法减少了干扰,并在 MNIST-Permutations 和 MNIST-Rotations 基准测试中表现出色,仅使用小规模的 episodic memory 缓冲区。

ABSTRACT

The core challenge with continual learning is catastrophic forgetting, the phenomenon that when neural networks are trained on a sequence of tasks they rapidly forget previously learned tasks. It has been observed that catastrophic forgetting is most severe when tasks are dissimilar to each other. We propose the use of sparse routing networks for continual learning. For each input, these network architectures activate a different path through a network of experts. Routing networks have been shown to learn to route similar tasks to overlapping sets of experts and dissimilar tasks to disjoint sets of experts. In the continual learning context this behaviour is desirable as it minimizes interference between dissimilar tasks while allowing positive transfer between related tasks. In practice, we find it is necessary to develop a new training method for routing networks, which we call co-training which avoids poorly initialized experts when new tasks are presented. When combined with a small episodic memory replay buffer, sparse routing networks with co-training outperform densely connected networks on the MNIST-Permutations and MNIST-Rotations benchmarks.

研究动机与目标

  • 为解决持续学习中灾难性遗忘问题,即神经网络在顺序训练过程中对先前学习任务的性能退化。
  • 开发一种固定容量的架构,避免网络规模随任务数量线性增长。
  • 在相似任务之间实现正向迁移,同时最小化不相似任务之间的干扰。
  • 克服路由网络在持续训练过程中专家初始化不佳的问题,该问题可能导致次优路由与干扰。
  • 将路由网络与 episodic memory 结合,以提升持续学习中的稳定性和性能。

提出的方法

  • 采用稀疏路由网络架构,每层包含多个专家,每个专家为一个全连接前馈网络。
  • 利用基于任务 ID 条件化的路由矩阵,确定每个输入激活的专家,实现稀疏、任务特定的路由。
  • 引入共训练机制:在新任务训练期间,示例也被传递给未使用的专家,以防止其保持未训练状态。
  • 使用随机梯度下降,并将路由概率作为掩码,仅更新被激活的专家,从而减少梯度干扰。
  • 将路由网络与小规模 episodic memory 回放缓冲区(大小为 1,000)结合,进一步稳定学习过程。
  • 通过路由矩阵与其自身的矩阵乘法,推断任务相似性,将路由模式可视化为任务嵌入。

实验结果

研究问题

  • RQ1稀疏路由网络是否能通过将相似任务路由至共享专家,从而减少持续学习中的灾难性遗忘?
  • RQ2共训练是否能有效防止持续训练中未使用专家的不良初始化?
  • RQ3与标准共享底部架构相比,路由网络在持续学习基准测试中的性能如何?
  • RQ4路由矩阵是否能捕捉有意义的任务相似性,例如在 MNIST-Rotations 中随旋转角度增加而变化的相似性?
  • RQ5将路由网络与 episodic memory 结合是否能提升平均准确率并减少负面负向迁移?

主要发现

  • 结合共训练的路由网络在 MNIST-Permutations 和 MNIST-Rotations 基准测试中均实现了比共享底部架构更高的平均准确率。
  • 该方法显著减少了负面负向迁移,任务准确率曲线随时间保持更平坦,表明早期任务的遗忘程度更低。
  • 在 MNIST-Rotations 中,推断出的任务相似性矩阵显示出块对角结构,证实了旋转角度相近的相似任务共享专家。
  • 旋转角度差异较大的任务(如 0° 和 180°)主要使用互不重叠的专家集合,最小化了干扰,支持了避免负面迁移的设计目标。
  • 尽管初始样本效率略低,路由网络在所有任务上均保持了稳定性能,在长期持续学习中优于共享底部模型。
  • 路由网络通过路由概率学习任务嵌入的能力,实现了可解释的任务相似性聚类,与 MNIST-Rotations 中预期的几何关系一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。