Skip to main content
QUICK REVIEW

[论文解读] Variational Prototyping-Encoder: One-Shot Learning with Prototypical Images

Junsik Kim, Tae-Hyun Oh|arXiv (Cornell University)|Apr 17, 2019
Domain Adaptation and Few-Shot Learning参考文献 30被引用 9
一句话总结

该论文提出变分原型编码器(VPE),一种少样本学习方法,通过变分自编码器将真实世界图像重建为对应的原型符号,从而学习解耦的潜在空间。通过将真实图像到原型图像的图像转换视为元任务,VPE捕捉了细粒度的基于外观的相似性,在GTSRB和logo数据集上优于度量学习基线方法,准确率提升最高达30.49%。

ABSTRACT

In daily life, graphic symbols, such as traffic signs and brand logos, are ubiquitously utilized around us due to its intuitive expression beyond language boundary. We tackle an open-set graphic symbol recognition problem by one-shot classification with prototypical images as a single training example for each novel class. We take an approach to learn a generalizable embedding space for novel tasks. We propose a new approach called variational prototyping-encoder (VPE) that learns the image translation task from real-world input images to their corresponding prototypical images as a meta-task. As a result, VPE learns image similarity as well as prototypical concepts which differs from widely used metric learning based approaches. Our experiments with diverse datasets demonstrate that the proposed VPE performs favorably against competing metric learning based one-shot methods. Also, our qualitative analyses show that our meta-task induces an effective embedding space suitable for unseen data representation.

研究动机与目标

  • 解决在真实图像与标准原型之间存在极端数据不平衡和领域差异情况下的少样本图形符号识别挑战。
  • 通过学习基于外观的相似性而非依赖预定义的距离度量,克服度量学习的局限性。
  • 构建一个可泛化的嵌入空间,支持对未见符号类别的开放集分类。
  • 利用成对的真实-原型图像数据训练生成模型,隐式学习鲁棒且对扰动不变的特征。
  • 仅使用每个新类别一个原型,实现有效的零样本和少样本分类。

提出的方法

  • 训练变分自编码器(VAE)将真实世界图像重建为对应的原型符号,以原型作为强监督信号。
  • 使用编码器将真实图像映射到潜在分布,同时解码器从潜在代码重建原型。
  • 通过重建损失优化VAE,促使潜在空间聚集在原型特征周围,隐式建模图像相似性。
  • 通过在学习到的潜在空间中进行最近邻分类执行推理,使用未见类别原型嵌入。
  • 将图像转换任务(真实 → 原型)视为元任务,以学习可泛化的、具有感知意义的表征。
  • 利用 $l_1$-归一化距离矩阵和t-SNE可视化分析学习到的嵌入质量与聚类结构。

实验结果

研究问题

  • RQ1在真实图像到原型图像的图像转换任务上进行训练的生成模型,是否能为少样本分类学习到比度量学习更有效且更具泛化能力的嵌入空间?
  • RQ2VPE模型在训练期间未见过的符号类别上泛化能力如何?
  • RQ3通过重建学习基于外观的相似性,是否能比基于标签的度量学习产生更好的聚类效果和判别性特征?
  • RQ4该模型在存在几何和光度失真时,从真实图像重建原型的能力有多强?
  • RQ5在t-SNE可视化和距离矩阵模式方面,学习到的潜在空间质量与现有基于度量的少样本学习者相比如何?

主要发现

  • 在GTSRB少样本分类基准上,VPE达到83.79%的准确率,显著优于第二名方法的53.30%。
  • 在Belga → Flickr32 logo数据集上,VPE准确率从40.95%提升至53.53%,表明其在logo识别任务上具有强大泛化能力。
  • VPE的距离矩阵呈现出与符号类别相对应的清晰块状模式,表明其有效捕捉了基于外观的相似性。
  • t-SNE可视化显示,VPE嵌入形成分离良好且具有判别性的聚类,而基线方法的分布则呈现部分混合状态。
  • 原型重建结果表明,即使在模糊和低分辨率条件下,VPE仍能捕捉到高层次的符号概念(如禁止性红圈、危险三角形)。
  • 该模型可泛化至开放集分类,因为在测试阶段仅需其原型即可对未见符号类别进行分类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。