[论文解读] Are Few-Shot Learning Benchmarks too Simple ? Solving them without Task Supervision at Test-Time
本文提出中心点网络(Centroid Networks),一种无测试时标签(NLT)基线方法,通过在测试时对支持集嵌入进行聚类而不使用标签,解决了少样本学习基准问题。结果表明,Omniglot基准可在不进行任务适应的情况下达到99.1%的准确率,揭示了当前基准可能过于简单,强调了需要更困难、跨领域的基准以公平评估少样本方法。
We show that several popular few-shot learning benchmarks can be solved with varying degrees of success without using support set Labels at Test-time (LT). To this end, we introduce a new baseline called Centroid Networks, a modification of Prototypical Networks in which the support set labels are hidden from the method at test-time and have to be recovered through clustering. A benchmark that can be solved perfectly without LT does not require proper task adaptation and is therefore inadequate for evaluating few-shot methods. In practice, most benchmarks cannot be solved perfectly without LT, but running our baseline on any new combinations of architectures and datasets gives insights on the baseline performance to be expected from leveraging a good representation, before any adaptation to the test-time labels.
研究动机与目标
- 探究流行的少样本学习基准是否真正评估了任务适应能力,还是仅通过不使用测试时支持集标签即可解决。
- 开发一种简单基线,以分离表示学习与特定任务适应带来的性能增益。
- 量化仅通过良好表示所能达到的基线性能,而无需任何测试时标签监督。
- 通过展示某些基准可在无正确任务适应的情况下被解决,揭示当前基准的局限性。
- 倡导开发更困难、跨领域的基准,以真正要求少样本泛化能力和基于标签的适应。
提出的方法
- 提出中心点网络,作为原型网络的改进版本,其在测试时隐藏支持集标签,并通过聚类恢复标签。
- 使用Sinkhorn K-Means算法将支持集嵌入聚类为类别组,将聚类视为可微分配问题。
- 应用匈牙利算法将预测的聚类索引与真实类别标签匹配,以在排列不变性下最大化准确率。
- 仅通过一次前向传播嵌入所有支持集和查询集,避免推理过程中迭代的标签优化。
- 使用与标准少样本方法相同的主干网络(如ResNet-12)和训练流程,确保公平比较。
- 对非归纳预测应用相同的后处理流程,以在无标签监督下实现归纳式少样本学习。
实验结果
研究问题
- RQ1像Omniglot和miniImageNet这样的流行少样本学习基准,是否可以在不使用测试时支持集标签的情况下被解决?
- RQ2这些基准上的性能在多大程度上源于强大表示,而非实际使用测试时标签进行的任务适应?
- RQ3NLT基线在不同基准上与最先进LT(使用标签)方法的性能相比如何?
- RQ4跨领域少样本基准是否显著更难,且对测试时标签监督的依赖性是否远高于同领域基准?
- RQ5基于聚类的NLT方法是否可有效应用于归纳式少样本学习和少样本聚类任务?
主要发现
- 中心点网络在Omniglot 5-way/5-shot上达到99.1%的NLT准确率,在20-way/5-shot上达到98.1%,表明该基准可在无测试时标签的情况下被解决。
- 在miniImageNet上,该NLT基线在使用FEAT特征的归纳式少样本学习中达到83.54%的准确率,优于非归纳式基线,并接近最先进LT方法的性能。
- 在Omniglot-CCN上,该NLT基线显著优于现有CCN变体(86.8% vs. 83.3%),且速度提升100倍,实现更简单高效。
- 跨领域基准如tiered-ImageNet和Meta-Dataset的NLT性能明显更低,表明其需要真正的任务适应,是评估少样本方法的更真实基准。
- 结果证实,支持集标签在跨领域少样本学习中远比在同领域基准中更为关键,凸显了领域偏移在评估中的重要性。
- 该NLT基线为分离表示学习性能与任务适应性能提供了强有力的参照点,提示当前许多基准可能尚不足以构成足够挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。