Skip to main content
QUICK REVIEW

[论文解读] Distance-Based Regularisation of Deep Networks for Fine-Tuning

Henry Gouk, Timothy M. Hospedales|arXiv (Cornell University)|Feb 19, 2020
Advanced Neural Network Applications参考文献 35被引用 6
一句话总结

本文提出一种基于距离的正则化方法,通过使用MARS(最大行绝对值和)范数将微调过程中的权重更新限制在预训练权重附近的小球体内,实现对深度神经网络的微调。理论与实证结果表明,基于MARS的约束优于欧几里得距离惩罚和标准微调方法,在图像分类基准上实现了更好的泛化性能和最先进水平的表现。

ABSTRACT

We investigate approaches to regularisation during fine-tuning of deep neural networks. First we provide a neural network generalisation bound based on Rademacher complexity that uses the distance the weights have moved from their initial values. This bound has no direct dependence on the number of weights and compares favourably to other bounds when applied to convolutional networks. Our bound is highly relevant for fine-tuning, because providing a network with a good initialisation based on transfer learning means that learning can modify the weights less, and hence achieve tighter generalisation. Inspired by this, we develop a simple yet effective fine-tuning algorithm that constrains the hypothesis class to a small sphere centred on the initial pre-trained weights, thus obtaining provably better generalisation performance than conventional transfer learning. Empirical evaluation shows that our algorithm works well, corroborating our theoretical results. It outperforms both state of the art fine-tuning competitors, and penalty-based alternatives that we show do not directly constrain the radius of the search space.

研究动机与目标

  • 开发一种理论基础坚实的微调正则化策略,通过控制权重从初始化点的移动距离来改善泛化性能。
  • 探究使用不同度量(如MARS与欧几里得)进行基于距离的正则化是否能在微调中带来更好的性能。
  • 比较基于惩罚的正则化与训练过程中对权重距离施加硬约束的有效性。
  • 提出一种基于Rademacher复杂度的新泛化界,明确依赖于权重从初始值移动的距离,而不依赖于覆盖数或模型分布。
  • 通过实证验证,MARS-based约束在实践中优于标准微调和基于惩罚的替代方法。

提出的方法

  • 推导出一种新的Rademacher复杂度泛化界,该界依赖于最终权重从初始值移动的距离,使用MARS范数和Frobenius范数。
  • 提出两种基于投影的微调算法:MARS-PGM和ℓ²-PGM,分别通过投影梯度法对MARS和欧几里得距离施加硬约束。
  • 提出一种基于惩罚的正则化方法,在损失函数中正则化MARS距离,作为与基于约束方法对比的基线。
  • 在MNIST上使用标准CNN架构,对边界和方法进行实证评估,测量训练过程中的模型复杂度和泛化性能。
  • 使用早停和无正则化训练作为基线,评估隐式正则化效应,并比较显式正则化策略。
  • 采用Adam优化器,并在整个训练过程中评估测试准确率和模型复杂度指标,以评估泛化性能和约束有效性。

实验结果

研究问题

  • RQ1基于权重从初始化点移动距离的泛化界是否比现有界提供更紧致且更相关的性能保证?
  • RQ2MARS范数是否比Frobenius范数或谱范数更适合用于测量卷积神经网络权重空间中的距离?
  • RQ3通过投影方法施加的硬约束是否优于基于惩罚的正则化?
  • RQ4基于MARS的正则化是否能带来优于标准微调和现有最先进方法的测试性能?
  • RQ5早停带来的隐式正则化与显式正则化策略在模型复杂度和泛化性能方面如何相互作用?

主要发现

  • 基于MARS的泛化界显著优于基于Frobenius或谱范数的界,尤其在卷积网络背景下表现更优。
  • 实证评估显示,MARS-PGM(使用MARS约束的投影梯度法)在MNIST上优于ℓ²-PGM和标准微调,实现了更高的测试准确率和更好的泛化性能。
  • 即使惩罚项被调整至与约束半径匹配,通过投影方法施加的硬约束仍优于基于惩罚的正则化。
  • 使用MARS距离作为正则化度量,相比欧几里得距离,能更有效地限制假设类,尤其在卷积架构中表现更优。
  • 尽管超参数不断增加,模型复杂度指标在训练过程中趋于平稳,表明早停带来的隐式正则化可能掩盖了显式正则化的全部优势。
  • 所提出的MARS-PGM方法在微调基准上实现了最先进性能,表明基于约束的正则化在深度学习中比基于惩罚的替代方法更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。