Skip to main content
QUICK REVIEW

[论文解读] RIFLE: Backpropagation in Depth for Deep Transfer Learning through Re-Initializing the Fully-connected LayEr

Xingjian Li, Haoyi Xiong|arXiv (Cornell University)|Jul 7, 2020
Domain Adaptation and Few-Shot Learning被引用 11
一句话总结

RIFLE 是一种用于深度迁移学习的新型正则化技术,通过在微调过程中周期性地用随机权重重新初始化全连接(FC)层,增强深层卷积神经网络(CNN)层的反向传播。这种周期性重新初始化向深层网络注入有意义的梯度更新,改善了低层次特征学习,在相同设置下相比 SOTA 方法(如 Dropout、DropConnect 和循环学习率)实现了 0.5%–2% 的更高测试准确率。

ABSTRACT

Fine-tuning the deep convolution neural network(CNN) using a pre-trained model helps transfer knowledge learned from larger datasets to the target task. While the accuracy could be largely improved even when the training dataset is small, the transfer learning outcome is usually constrained by the pre-trained model with close CNN weights (Liu et al., 2019), as the backpropagation here brings smaller updates to deeper CNN layers. In this work, we propose RIFLE - a simple yet effective strategy that deepens backpropagation in transfer learning settings, through periodically Re-Initializing the Fully-connected LayEr with random scratch during the fine-tuning procedure. RIFLE brings meaningful updates to the weights of deep CNN layers and improves low-level feature learning, while the effects of randomization can be easily converged throughout the overall learning procedure. The experiments show that the use of RIFLE significantly improves deep transfer learning accuracy on a wide range of datasets, out-performing known tricks for the similar purpose, such as Dropout, DropConnect, StochasticDepth, Disturb Label and Cyclic Learning Rate, under the same settings with 0.5% -2% higher testing accuracy. Empirical cases and ablation studies further indicate RIFLE brings meaningful updates to deep CNN layers with accuracy improved.

研究动机与目标

  • 为解决深度迁移学习中因全连接(FC)层快速收敛而导致反向传播无法有效更新深层 CNN 层的问题。
  • 通过实现更有效的误差反向传播至深层网络层,改善迁移学习中的低层次特征学习。
  • 提出一种简单而有效的正则化策略,在不损害模型收敛性的情况下增强知识迁移。
  • 克服使用预训练模型进行微调时,因 FC 层快速收敛而导致的过拟合和权重更新不足问题。
  • 通过受控的随机化,在保留预训练知识与允许充分适应目标数据集之间实现平衡。

提出的方法

  • 该方法将微调过程划分为相等的时间段,并在每个时间段开始时用随机权重重新初始化全连接(FC)层。
  • 在重新初始化的同时应用循环学习率调度,以确保整个训练过程中稳定收敛。
  • 该方法特别针对 FC 层进行重新初始化,同时保留预训练的卷积滤波器,从而实现更深层的梯度流动。
  • 重新初始化为训练动态引入非平凡的扰动,帮助网络逃离由预训练权重引起的局部极小值。
  • 该方法设计轻量化,与现有深度学习框架兼容,仅需极少的架构修改。
  • 通过引入受控噪声实现随机重新初始化,避免过拟合,同时保持整体训练稳定性。

实验结果

研究问题

  • RQ1周期性地重新初始化全连接层是否能改善迁移学习中深层卷积层的梯度流动?
  • RQ2与固定 FC 权重的标准微调相比,重新初始化 FC 层是否能带来更好的低层次特征学习?
  • RQ3RIFLE 在深度迁移学习准确率方面是否能超越已知的正则化技术(如 Dropout、DropConnect 和随机深度)?
  • RQ4RIFLE 在训练过程中如何影响不同网络层的梯度大小和分布?
  • RQ5RIFLE 在多大程度上减少了对源数据集特征的依赖,并改善了对目标数据集的适应能力?

主要发现

  • 在相同设置下,RIFLE 相较于基线微调和已知的正则化技术(如 Dropout、DropConnect 和循环学习率),测试准确率提升 0.5%–2%。
  • 重新初始化后,深层网络中梯度大小被周期性地重新激活,防止了标准微调中观察到的梯度提前消失现象。
  • 与原始 L² 正则化相比,RIFLE 下深层网络中梯度的 Frobenius 范数显著更高,表明反向传播持续进行。
  • 实证分析表明,RIFLE 学习到的低层次特征更接近真实标签的基线,学习到的权重与真实权重之间的最优传输距离减少了 14%。
  • 在 MLP 基线实验中,RIFLE 实现了更好的泛化能力且未出现过拟合,测试损失更低(3.98×10⁻³)相较于基线(1.16×10⁻²)。
  • 消融实验确认性能提升源于更深层次的反向传播,而非超参数调优,因使用了相同的学习率和网络架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。