Skip to main content
QUICK REVIEW

[论文解读] Supermasks in Superposition

Mitchell Wortsman, Vivek Ramanujan|arXiv (Cornell University)|Jun 26, 2020
Domain Adaptation and Few-Shot Learning参考文献 51被引用 8
一句话总结

Supermasks in Superposition (SupSup) 通过使用固定且随机初始化的神经网络,并学习特定于任务的子网络(即超掩码),实现了对数千项任务的持续学习而不会发生灾难性遗忘。它通过基于梯度的优化方法对超掩码的线性叠加进行任务身份推断,在多达 2500 项任务中仅用一步梯度更新即可实现准确推断,同时通过霍普菲尔德网络存储池实现零样本任务发现和恒定内存大小。

ABSTRACT

We present the Supermasks in Superposition (SupSup) model, capable of sequentially learning thousands of tasks without catastrophic forgetting. Our approach uses a randomly initialized, fixed base network and for each task finds a subnetwork (supermask) that achieves good performance. If task identity is given at test time, the correct subnetwork can be retrieved with minimal memory usage. If not provided, SupSup can infer the task using gradient-based optimization to find a linear superposition of learned supermasks which minimizes the output entropy. In practice we find that a single gradient step is often sufficient to identify the correct mask, even among 2500 tasks. We also showcase two promising extensions. First, SupSup models can be trained entirely without task identity information, as they may detect when they are uncertain about new data and allocate an additional supermask for the new training distribution. Finally the entire, growing set of supermasks can be stored in a constant-sized reservoir by implicitly storing them as attractors in a fixed-sized Hopfield network.

研究动机与目标

  • 通过利用未训练且随机初始化的子网络来解决持续学习中的灾难性遗忘问题。
  • 在测试时无需任务身份信息,仅通过超掩码组合的基于梯度的优化实现准确的任务推断。
  • 在极低内存开销下将持续学习扩展至数千项任务。
  • 在无需先前身份监督的情况下支持对新任务的零样本发现。
  • 通过固定大小的霍普菲尔德网络存储池高效存储不断增长的超掩码集合。

提出的方法

  • 使用一个固定且随机初始化的基础神经网络,并为每个任务学习一个唯一的二值超掩码以构成子网络。
  • 在测试时通过优化已学习超掩码的凸组合以最小化输出熵来推断任务身份。
  • 仅用一步梯度更新即可在最多 2500 种 MNIST 排列中识别出正确任务。
  • 引入一种机制以检测不确定性,并在训练期间无任务身份信息的情况下为未见的任务分布分配新的超掩码。
  • 通过霍普菲尔德网络存储池将超掩码隐式存储于固定内存中,将其视为吸引子。
  • 使用三字母分类法(如 GG、GN、NNs)系统性地评估在不同任务身份可用性条件下的持续学习场景。

实验结果

研究问题

  • RQ1一个固定且随机初始化的网络是否能够支持在不发生灾难性遗忘的情况下学习数千项任务?
  • RQ2在测试时是否可以仅通过超掩码组合的基于梯度的优化,在无显式监督的情况下准确推断任务身份?
  • RQ3SupSup 是否能够在无先前任务身份信息的情况下检测并适应新的未见任务分布?
  • RQ4是否能够通过霍普菲尔德网络存储池在恒定内存中存储所有已学习的超掩码?
  • RQ5超掩码稀疏度和网络过参数化如何影响推断准确率和鲁棒性?

主要发现

  • 在 GG 场景下,SupSup 在 SplitImageNet 上实现了最先进性能,且存储量和训练时间均低于近期基线方法。
  • 在 GN 场景下,SupSup 在 2500 种 MNIST 排列中保持高准确率且无遗忘现象,仅通过一步梯度更新完成任务推断。
  • 在 NNs 场景下,SupSup 通过检测不确定性并自主分配新超掩码,成功实现了对新任务的发现。
  • 即使存在冗余神经元,该方法仍能实现准确的任务推断,且对分布偏移具有更强鲁棒性。
  • 霍普菲尔德网络存储池实现了所有超掩码的隐式存储,且内存大小固定,同时保持了完整的模型容量。
  • 实证结果表明,通过梯度优化实现的输出熵最小化能够可靠地识别出正确的超掩码,即使在高维任务空间中亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。