Skip to main content
QUICK REVIEW

[论文解读] Fine-Grain Few-Shot Vision via Domain Knowledge as Hyperspherical Priors

B. Haney, Alexander Lavin|arXiv (Cornell University)|May 23, 2020
Domain Adaptation and Few-Shot Learning参考文献 16被引用 7
一句话总结

本文提出了一种超球面原型网络,将领域知识作为信息性先验以提升少样本细粒度视觉分类性能。通过利用先验属性(如鸟类颜色、翅膀图案)将类别原型嵌入超球面,该方法在 CUB-200-2011 数据集上实现了最先进的 1-shot 准确率(59.48%),且训练时间相比标准欧几里得原型网络提升了 5 倍。

ABSTRACT

Prototypical networks have been shown to perform well at few-shot learning tasks in computer vision. Yet these networks struggle when classes are very similar to each other (fine-grain classification) and currently have no way of taking into account prior knowledge (through the use of tabular data). Using a spherical latent space to encode prototypes, we can achieve few-shot fine-grain classification by maximally separating the classes while incorporating domain knowledge as informative priors. We describe how to construct a hypersphere of prototypes that embed a-priori domain information, and demonstrate the effectiveness of the approach on challenging benchmark datasets for fine-grain classification, with top results for one-shot classification and 5x speedups in training time.

研究动机与目标

  • 解决少样本细粒度分类中的挑战,即类间差异微小会阻碍模型性能。
  • 通过将先验领域知识(如二值属性)融入潜在空间,提升原型泛化能力。
  • 利用非欧几里得超球面几何,实现在高维嵌入下的更好原型分离与鲁棒性。
  • 通过预计算的先验实现数据无关的原型优化,从而减少训练时间。
  • 证明语义先验可增强细粒度任务中的聚类效果与推理稳定性。

提出的方法

  • 该方法采用超球面潜在空间,使类别原型在最大角度分离下嵌入,以提升可区分性。
  • 领域知识以二值属性(如翅膀颜色、背部颜色)形式编码,并通过余弦相似度最大化计算原型在超球面上的位置。
  • 原型通过约束优化过程预先初始化,以最小化任意两个类别原型之间的最大余弦相似度。
  • 推理通过计算图像嵌入与所有类别原型之间的余弦相似度完成,选择相似度最高的类别作为预测结果。
  • 模型采用 ResNet32 主干网络,使用 SGD 优化,并应用标准数据增强(随机裁剪、水平翻转)。
  • 超球面原型空间仅训练一次并重复使用,实现数据无关的优化,从而显著加快训练速度。

实验结果

研究问题

  • RQ1将领域知识编码为二值属性是否能提升少样本细粒度分类的性能?
  • RQ2使用带有先验的超球面潜在空间是否能实现比欧几里得空间或最大展开球面空间更好的原型分离与鲁棒性?
  • RQ3是否可通过数据无关的原型初始化实现训练时间减少而不损失准确率?
  • RQ4该超球面模型是否能避免高维空间中的表面积坍塌问题?
  • RQ5语义先验的引入如何影响细粒度任务中的聚类与泛化能力?

主要发现

  • 所提方法在 CUB-200-2011 数据集上实现了 1-shot 五分类准确率 59.48%,优于标准欧几里得原型和最大展开超球面原型方法。
  • 训练时间实现 5 倍加速,单个训练周期从 96 秒缩短至 20 秒(在 GeForce RTX 2080 Ti 上)。
  • 模型在高维超球面中保持稳定性能,在 64 维和 128 维下均未出现表面积坍塌或不稳定性现象。
  • 引入领域先验显著改善了原型定位效果,T-SNE 可视化显示语义相似的类别(如麻雀)聚集在一起。
  • 在 5-shot 五分类设置下,方法达到 71.19% 的准确率,表明其能从极少数样本中实现强大泛化能力。
  • 模型对输入噪声具有鲁棒性,能正确将带噪声的 Baird 麻雀样本分类为麻雀,并对语义相近但不同的类别(如 American Pipit)赋予较低置信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。