Skip to main content
QUICK REVIEW

[论文解读] Comparing Transfer and Meta Learning Approaches on a Unified Few-Shot Classification Benchmark

Vincent Dumoulin, Neil Houlsby|arXiv (Cornell University)|Apr 6, 2021
Domain Adaptation and Few-Shot Learning被引用 11
一句话总结

本文提出 VTAB+MD,一个将 VTAB 与 Meta-Dataset 融合的统一 few-shot 分类基准,以实现迁移学习与元学习方法的直接比较。结果表明,大规模迁移学习模型(如 BiT-L)在两个基准上均优于当前最先进的元学习器,尤其在分布外任务上表现更优,凸显了模型规模与数据多样性的重要性,同时揭示了元学习在泛化能力与实现可扩展性方面的局限性。

ABSTRACT

Meta and transfer learning are two successful families of approaches to few-shot learning. Despite highly related goals, state-of-the-art advances in each family are measured largely in isolation of each other. As a result of diverging evaluation norms, a direct or thorough comparison of different approaches is challenging. To bridge this gap, we perform a cross-family study of the best transfer and meta learners on both a large-scale meta-learning benchmark (Meta-Dataset, MD), and a transfer learning benchmark (Visual Task Adaptation Benchmark, VTAB). We find that, on average, large-scale transfer methods (Big Transfer, BiT) outperform competing approaches on MD, even when trained only on ImageNet. In contrast, meta-learning approaches struggle to compete on VTAB when trained and validated on MD. However, BiT is not without limitations, and pushing for scale does not improve performance on highly out-of-distribution MD tasks. In performing this study, we reveal a number of discrepancies in evaluation norms and study some of these in light of the performance gap. We hope that this work facilitates sharing of insights from each community, and accelerates progress on few-shot learning.

研究动机与目标

  • 通过创建一个共享基准,弥合迁移学习与元学习社区之间的评估差距。
  • 在统一的 few-shot 分类协议下,实现两个领域最先进方法的直接比较。
  • 探究一个领域中的进展是否能泛化到另一领域,特别是在分布偏移情况下的表现。
  • 分析模型规模、数据、归一化方式与输入分辨率对 few-shot 泛化性能的影响。
  • 识别元学习在泛化能力与实现可扩展性方面的局限性。

提出的方法

  • 作者将视觉任务迁移基准(VTAB)与元数据集(MD)整合为一个统一的评估协议,称为 VTAB+MD。
  • 在相同的 few-shot 分类协议下,对最先进的迁移学习模型(如 BiT-L)与元学习器(如 CTX)在两个基准上进行评估。
  • 对 BiT-L 进行消融实验,分别调整网络容量、输入分辨率、归一化层(GNWS 与 BN)以及上游训练数据(ImageNet、ImageNet-21k、JFT)。
  • 通过数据去重与类别移除的消融实验,评估领域覆盖范围与数据量对性能的影响。
  • 在 MD 的多样化数据源(如 Omniglot、QuickDraw、Traffic Sign)之间比较模型性能,以研究分布偏移的影响。
  • 分析组归一化结合权重标准化(GNWS)等归一化策略在 few-shot 泛化中的鲁棒性。

实验结果

研究问题

  • RQ1在统一的 few-shot 分类基准上,大规模迁移学习是否优于元学习?
  • RQ2模型规模、输入分辨率与归一化策略如何影响在多样化 few-shot 任务上的性能?
  • RQ3与仅增加数据量相比,数据多样性与上游领域覆盖范围在多大程度上能提升 few-shot 泛化能力?
  • RQ4为何元学习器在分布外任务上泛化能力差,尤其是在 MD 上训练但在 VTAB 上评估时?
  • RQ5元学习中的实现约束是否会导致无法有效使用大尺寸主干网络与高分辨率输入?

主要发现

  • BiT-L 在统一的 VTAB+MD 基准上达到最先进性能,在 MD 与 VTAB 上均优于竞争性的元学习器。
  • 在 MD-v2 上,BiT-L 在 ImageNet 上训练的模型平均准确率比 CTX 高 1.69%,主要提升了已在强表现数据源上的性能。
  • 对于高度分布外的任务(如 Omniglot 与 QuickDraw),增加模型大小与分辨率不仅无法提升性能,反而可能造成性能下降。
  • 将 BiT-L 的 GNWS 归一化替换为批量归一化,会在所有 MD-v2 数据源上一致地降低性能,表明 GNWS 对 few-shot 泛化至关重要。
  • 在 JFT 上训练并未带来性能的统一提升;对于 Traffic Sign,ImageNet 的表现优于 ImageNet-21k 与 JFT,表明数据分布比规模本身更具决定性。
  • 仅移除 0.002% 与飞机和鸟类相关的 JFT 数据,便显著降低 BiT-L 在这些 MD-v2 测试数据源上的表现,证明领域覆盖范围比数据量更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。