Skip to main content
QUICK REVIEW

[论文解读] AdaFilter: Adaptive Filter Fine-tuning for Deep Transfer Learning

Yunhui Guo, Yandong Li|arXiv (Cornell University)|Nov 21, 2019
Domain Adaptation and Few-Shot Learning参考文献 31被引用 5
一句话总结

AdaFilter 是一种用于迁移学习的新型自适应微调方法,通过使用循环门控网络,基于每个样本的选择性地优化预训练模型中的卷积滤波器子集。通过根据输入激活动态选择要微调的滤波器,AdaFilter 减少了过拟合并提升了准确率,在七个图像分类数据集上平均误差降低了 2.54%。

ABSTRACT

There is an increasing number of pre-trained deep neural network models. However, it is still unclear how to effectively use these models for a new task. Transfer learning, which aims to transfer knowledge from source tasks to a target task, is an effective solution to this problem. Fine-tuning is a popular transfer learning technique for deep neural networks where a few rounds of training are applied to the parameters of a pre-trained model to adapt them to a new task. Despite its popularity, in this paper, we show that fine-tuning suffers from several drawbacks. We propose an adaptive fine-tuning approach, called AdaFilter, which selects only a part of the convolutional filters in the pre-trained model to optimize on a per-example basis. We use a recurrent gated network to selectively fine-tune convolutional filters based on the activations of the previous layer. We experiment with 7 public image classification datasets and the results show that AdaFilter can reduce the average classification error of the standard fine-tuning by 2.54%.

研究动机与目标

  • 为解决标准微调的局限性,即对所有样本应用统一的更新策略,且在小目标数据集上存在过拟合风险。
  • 通过允许目标数据集中的不同样本微调不同的预训练滤波器集合,实现更有效的知识迁移。
  • 通过智能的滤波器复用减少每个样本的可训练参数数量,缓解低数据场景下的过拟合问题。
  • 开发一种轻量级、高效的策略网络,以建模滤波器选择中的层间依赖关系。
  • 通过学习随输入变化的自适应微调策略,提升泛化能力和训练效率。

提出的方法

  • AdaFilter 使用一个循环门控网络,基于前一层的激活来条件化滤波器选择,从而实现逐层、基于样本的决策,确定哪些滤波器需要微调。
  • 该方法引入了一种门控批量归一化层,分别对预训练和微调后的特征图进行归一化,以应对源任务和目标任务之间的领域偏移。
  • 滤波器选择通过一个可学习的门控机制完成,该机制为每个滤波器输出一个二值掩码,决定其是被复用还是被更新。
  • 循环结构在层间保持隐藏状态,使策略网络能够建模特征表示和滤波器相关性中的层次依赖关系。
  • 策略网络与主干模型端到端联合训练,使用标准反向传播,门控网络指导每个样本应更新哪些滤波器。
  • 该方法支持高效微调,每个样本的有效参数更少,从而在小数据集上减少过拟合。

实验结果

研究问题

  • RQ1与标准微调相比,基于样本的自适应滤波器选择是否能提升迁移学习性能?
  • RQ2基于输入特定激活动态选择要微调的滤波器,是否能在小目标数据集上实现更好的泛化?
  • RQ3与基于 CNN 的替代方案相比,使用循环门控网络生成策略在准确率和参数效率方面表现如何?
  • RQ4门控批量归一化在考虑预训练特征与目标特征之间分布差异方面,能在多大程度上提升性能?
  • RQ5自适应微调是否在整个训练过程中始终优于标准微调?

主要发现

  • 在七个公开图像分类数据集上,AdaFilter 相较于标准微调将平均分类误差降低了 2.54%。
  • 该方法在每个训练周期均持续优于标准微调,表明其知识迁移更高效,优化动态更优。
  • 门控批量归一化通过分别归一化预训练和微调后的特征图,提升了准确率,在部分数据集上准确率提升最高达 0.42%。
  • 循环门控网络优于基于 CNN 的策略网络,其在准确率上表现更优,且由于其轻量级的序列化设计,参数量显著更少。
  • 在 Caltech256-30 和 Caltech256-60 上,策略网络显示浅层更倾向于复用滤波器,而深层则更倾向于微调,体现了直观的任务特定适应性。
  • 消融研究证实,循环门控机制和门控批量归一化均为该方法卓越性能的关键组成部分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。