Skip to main content
QUICK REVIEW

[论文解读] Beyond Fine Tuning: A Modular Approach to Learning on Small Data

Ark Anderson, Kyle Shaffer|arXiv (Cornell University)|Nov 6, 2016
Domain Adaptation and Few-Shot Learning参考文献 23被引用 7
一句话总结

本文提出了一种神经模块化迁移学习方法,通过将固定预训练神经网络模块与可训练模块结合,在无需微调的情况下学习分布偏移。通过保留预训练表征并添加新的、任务特定的模块,该方法在小样本基准测试(如CIFAR-100、文本分类和细粒度图像识别)上的准确率显著提高,最高提升达5%,优于标准微调方法。

ABSTRACT

In this paper we present a technique to train neural network models on small amounts of data. Current methods for training neural networks on small amounts of rich data typically rely on strategies such as fine-tuning a pre-trained neural network or the use of domain-specific hand-engineered features. Here we take the approach of treating network layers, or entire networks, as modules and combine pre-trained modules with untrained modules, to learn the shift in distributions between data sets. The central impact of using a modular approach comes from adding new representations to a network, as opposed to replacing representations via fine-tuning. Using this technique, we are able surpass results using standard fine-tuning transfer learning approaches, and we are also able to significantly increase performance over such approaches when using smaller amounts of data.

研究动机与目标

  • 解决在每类少于100个样本的小数据集上训练深度神经网络的挑战。
  • 克服标准微调的局限性,后者会覆盖预训练特征并导致灾难性遗忘。
  • 在通过模块化组合学习新任务特定特征的同时,保留预训练网络的表征能力。
  • 在图像分类和文本分类等多样化领域的小样本任务中展示性能提升。
  • 开发一种可扩展的模块化架构,实现在不重新训练或替换现有网络组件的情况下进行迁移学习。

提出的方法

  • 将预训练神经网络层或整个网络视为权重冻结的固定模块。
  • 在高层架构中将这些固定预训练模块与可训练、未初始化的模块结合。
  • 通过连接多个模块的输出(例如,来自不同网络的LSTM层)形成共享表征层。
  • 使用门控循环单元(GRUs)或类似层处理连接后的表征,并预测最终的类别概率。
  • 端到端训练新模块,同时保持预训练模块冻结,以保留其学习到的特征。
  • 将该模块化架构应用于多样化任务,包括图像分类(CIFAR-100、Stanford Cars)和文本分类(IMDB情感)。

实验结果

研究问题

  • RQ1是否一种保留预训练特征的模块化架构能在小样本学习任务上优于标准微调?
  • RQ2将多个预训练模块与可训练模块结合,与单网络微调相比,如何改善特征学习?
  • RQ3该模块化方法在多大程度上缓解了迁移学习中的灾难性遗忘?
  • RQ4该模块化方法是否能在图像和文本等不同模态的数据上泛化,且仅使用有限的标注样本?
  • RQ5当每类训练数据仅限于几十个样本时,该模块化方法是否能实现高于微调的准确率?

主要发现

  • 在仅使用500个训练样本的情况下,该模块化方法在IMDB情感分类任务上达到了69.6%的准确率,比表现第二好的模型(64.9%)高出4.7个百分点。
  • 在CIFAR-100上使用有限数据时,该模块化模型超越了标准微调,展现出在小样本设定下的优越性能。
  • 当训练数据稀缺时,该方法显著优于微调,尤其在每类少于100个样本时表现更优。
  • 该模块化网络在10次不同的随机权重初始化下表现稳定,平均准确率为69.6%,表明对初始化方差具有鲁棒性。
  • 该模块化架构实现了互补的特征学习,其中新模块捕捉到了预训练网络所遗漏的细微模式。
  • 该方法在保持预训练模型表征能力的同时,增加了新的、任务特定的表征,避免了灾难性遗忘。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。