Skip to main content
QUICK REVIEW

[论文解读] Overcoming Multi-Model Forgetting

Yassine Benyahia, Kaicheng Yu|ArXiv.org|Feb 21, 2019
Domain Adaptation and Few-Shot Learning被引用 12
一句话总结

本文提出权重可塑性损失(WPL),一种基于统计学动机的正则化方法,可减少多模型遗忘问题——即在深度神经网络的顺序训练过程中,由于共享参数的更新导致先前训练模型性能下降的现象。WPL 依据参数对先前模型的重要性动态调整共享权重的学习率,使严格收敛设置下遗忘减少高达 99%,松散收敛设置下减少 52%,并在神经架构搜索中显著提升性能(例如,在 PTB 数据集上困惑度降至 61.9,而无 WPL 时为 65.01)。

ABSTRACT

We identify a phenomenon, which we refer to as multi-model forgetting, that occurs when sequentially training multiple deep networks with partially-shared parameters; the performance of previously-trained models degrades as one optimizes a subsequent one, due to the overwriting of shared parameters. To overcome this, we introduce a statistically-justified weight plasticity loss that regularizes the learning of a model's shared parameters according to their importance for the previous models, and demonstrate its effectiveness when training two models sequentially and for neural architecture search. Adding weight plasticity in neural architecture search preserves the best models to the end of the search and yields improved results in both natural language processing and computer vision tasks.

研究动机与目标

  • 解决多模型遗忘问题,即在后续模型训练过程中,由于共享参数被覆盖,导致先前训练模型性能下降。
  • 指出性能下降程度随共享层数量增加而加剧,尤其在参数共享的顺序训练中更为显著。
  • 提出一种基于统计学原理的正则化方法,通过根据参数对先前模型的重要性调整学习动态,保留先前学习到的知识。
  • 在严格和松散收敛场景下均证明 WPL 的有效性,尤其在神经架构搜索(NAS)流程中表现突出。
  • 表明减少遗忘可显著提升下游 NLP 和计算机视觉任务中最终模型的性能,且无需大量超参数调优。

提出的方法

  • 在温和假设下,将学习目标表述为在给定训练数据条件下,最大化共享参数与私有参数的后验概率。
  • 推导出权重可塑性损失(WPL),通过使共享参数的更新量与其对先前训练模型的重要性成反比,实现对共享参数的正则化。
  • 利用费雪信息量估算参数重要性,使模型能减缓对早期模型关键权重的更新。
  • 在顺序训练框架中应用 WPL,即各模型依次训练,共享层在每个阶段均被更新。
  • 将 WPL 集成到 ENAS 和 NAO 等神经架构搜索方法中,这些方法利用权重共享以加速搜索过程。
  • 在 NAS 实验中采用输出 dropout 和路径丢弃策略,以评估 WPL 在不同搜索配置下的鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1在具有共享参数的顺序训练模型中,多模型遗忘对性能的损害程度如何?
  • RQ2是否能够通过一种统计上合理的正则化方法,在共享参数设置下减少遗忘,同时保持训练效率?
  • RQ3在神经架构搜索中,WPL 在松散收敛状态下减少遗忘的效率如何?
  • RQ4与标准 NAS 方法相比,WPL 是否能提升下游任务(如语言建模和图像分类)的最终模型准确率?
  • RQ5WPL 是否能泛化至不同 NAS 框架(如 ENAS 和 NAO),在不同 dropout 策略和权重共享策略下均表现有效?

主要发现

  • 当模型 A 完全收敛训练时,WPL 可将多模型遗忘减少高达 99%,显著保留其在后续模型 B 训练过程中的性能。
  • 在更贴近实际的松散收敛设置下,WPL 仍可将遗忘减少 52%,展现出在实际训练场景中的鲁棒性。
  • 在使用 ENAS 的神经架构搜索中,WPL 将受影响最严重的模型遗忘减少 51%,在所有采样模型上平均减少 95%。
  • 通过 WPL 找到的最佳架构在 PTB 语言建模数据集上达到 61.9 的困惑度,优于 ENAS(65.01),甚至超过未调优的 ENAS*(63.26),且无需大量超参数调优。
  • 在 CIFAR10 图像分类任务中,WPL 将 Top-1 错误率从 ENAS 的 4.87% 降低至 3.81%,在视觉与 NLP 任务中均表现出一致的性能提升。
  • WPL 在其他 NAS 方法(如 NAO)中也表现出良好泛化能力,可在不同 dropout 率和训练策略下(包括激进的路径丢弃)有效减少遗忘。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。