Skip to main content
QUICK REVIEW

[论文解读] Dynamic Input Structure and Network Assembly for Few-Shot Learning

Nathan Hilliard, Nathan O. Hodas|arXiv (Cornell University)|Aug 22, 2017
Domain Adaptation and Few-Shot Learning参考文献 7被引用 3
一句话总结

本文提出了一种用于少样本学习的动态输入结构与网络组装技术,使单一模型能够在不重新训练的情况下泛化于每类支持样本数量不同的情况,通过在静态编译图(如TensorFlow)中共享权重实现。通过在小批量中使用变化的样本数量进行训练,该模型在Caltech-UCSD Birds数据集上的准确率最高达到90.3%,显著优于固定尺寸基线模型,证明了其在无需微调情况下的强大泛化能力。

ABSTRACT

The ability to learn from a small number of examples has been a difficult problem in machine learning since its inception. While methods have succeeded with large amounts of training data, research has been underway in how to accomplish similar performance with fewer examples, known as one-shot or more generally few-shot learning. This technique has been shown to have promising performance, but in practice requires fixed-size inputs making it impractical for production systems where class sizes can vary. This impedes training and the final utility of few-shot learning systems. This paper describes an approach to constructing and training a network that can handle arbitrary example sizes dynamically as the system is used.

研究动机与目标

  • 解决少样本学习模型需要固定大小输入的局限性,以提升在支持样本数量可变的真实系统中的部署能力。
  • 使单一深度学习模型能够在推理时处理每类任意数量的样本,提升在生产系统中的实用性。
  • 通过在优化过程中使用多样化的样本数量进行训练,减少过拟合并提升泛化能力。
  • 在不重新训练或修改网络架构的前提下,实现从2-shot到5-shot等多种设置下的高性能表现。

提出的方法

  • 该模型采用孪生两阶段架构:第一阶段为关系阶段,通过支持样本之间的两两比较计算类别嵌入;第二阶段为度量学习阶段,将查询样本与每个类别嵌入进行比较。
  • 使用预训练的ResNet-50(Omniglot数据集使用更简单的CNN)提取图像特征,将维度降低至2048维后进行后续处理。
  • 关系阶段通过所有两两表示的平均值计算类别嵌入:$ R(c_n) = \frac{1}{\binom{n}{2}} \sum_{i<j} g_\theta(c_i, c_j) $,其中 $ g_\theta $ 为共享的孪生网络。
  • 通过预计算不同样本数量下的输入-输出张量映射,实现动态网络组装,借助内存中的查找表实现小批量内大小无关的推理。
  • 使用随机梯度下降配合动量进行端到端训练,每个训练小批量中随机采样不同的样本数量(如2至5-shot),以促进泛化。
  • 所有样本数量下共享权重,实现参数效率,并使模型在不修改网络架构的情况下泛化于不同shot设置。

实验结果

研究问题

  • RQ1少样本学习模型是否能在不重新训练的情况下,有效泛化于每类支持样本数量不同的情况?
  • RQ2在训练过程中使用动态变化的样本数量是否能减少过拟合并提升对未见shot设置的泛化能力?
  • RQ3静态编译的深度学习框架(如TensorFlow)是否可通过权重共享与运行时组装支持动态输入大小?
  • RQ4当在未见过的样本数量上评估时,固定大小模型与动态组装模型的性能表现如何?

主要发现

  • 在5-shot的Caltech-UCSD Birds基准上,动态输入模型达到了90.3%的准确率,显著优于最佳固定大小模型(5-shot下为74.7%)。
  • 即使在评估时使用高于训练时的shot设置,该动态模型仍保持高性能,表明其在不同shot水平间具备强大的泛化能力。
  • 在Caltech-UCSD Birds与Omniglot数据集上,该动态模型在所有shot设置下均优于所有固定大小基线模型,其中在5-shot Omniglot上准确率提升最高达15.5个百分点。
  • 训练过程中随机变化样本数量有效减少了过拟合,提升了模型鲁棒性,表现为在不同shot水平下性能保持一致。
  • 使用预训练特征与共享权重,仅通过极少的架构修改即实现高性能,且计算开销低。
  • 动态网络组装技术成功实现在静态图框架中的大小无关推理,使模型具备生产部署能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。