Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Learning with Generative Latent Prototype Model

Yanan Li, Donghui Wang|arXiv (Cornell University)|May 26, 2017
Domain Adaptation and Few-Shot Learning参考文献 31被引用 18
一句话总结

该论文提出了一种生成式潜在原型模型(GLaP),用于零样本学习,通过潜在原型生成未见类别的虚拟实例,利用概率生成减少域偏移。通过在共享语义空间中建模原型并生成合成数据,GLaP在AwA数据集上达到83.45%的准确率,在CUB数据集上达到52.79%的准确率,实现最先进性能。

ABSTRACT

Zero-shot learning, which studies the problem of object classification for categories for which we have no training examples, is gaining increasing attention from community. Most existing ZSL methods exploit deterministic transfer learning via an in-between semantic embedding space. In this paper, we try to attack this problem from a generative probabilistic modelling perspective. We assume for any category, the observed representation, e.g. images or texts, is developed from a unique prototype in a latent space, in which the semantic relationship among prototypes is encoded via linear reconstruction. Taking advantage of this assumption, virtual instances of unseen classes can be generated from the corresponding prototype, giving rise to a novel ZSL model which can alleviate the domain shift problem existing in the way of direct transfer learning. Extensive experiments on three benchmark datasets show our proposed model can achieve state-of-the-art results.

研究动机与目标

  • 解决由于可见类别与未见类别之间数据分布不一致导致的零样本学习中的域偏移问题。
  • 通过在训练过程中利用语义表征而非仅推理阶段,提升零样本学习的泛化能力。
  • 通过共享潜在空间中的生成概率框架,建模类别之间的语义关系。
  • 利用基于原型的生成方法,为未见类别生成合成训练实例,增强分类器的鲁棒性。
  • 证明互补的视觉与语义特征可提升零样本场景下的识别性能。

提出的方法

  • 假设每个类别在潜在空间中由唯一原型表示,观测特征(图像、文本)从这些原型生成。
  • 将潜在原型建模为具有先验分布的随机变量,实现虚拟实例的随机生成。
  • 通过潜在空间中的线性重构编码原型之间的语义关系,保留类别相似性。
  • 利用原型和语义特征为未见类别生成虚拟训练实例,有效扩展训练集。
  • 在真实可见数据与生成的虚拟未见实例组合数据上训练分类器,以提升零样本泛化能力。
  • 采用联合学习策略,同时使用可见类别的均值向量与生成的虚拟实例,以提升性能。

实验结果

研究问题

  • RQ1通过潜在原型的生成建模,能否通过缓解域偏移来提升零样本学习性能?
  • RQ2基于原型的虚拟实例生成在提升未见类别间分类器泛化能力方面有多有效?
  • RQ3结合多种模态(如视觉与文本特征)是否能提升零样本学习中的识别准确率?
  • RQ4语义表征的质量在多大程度上影响生成式零样本学习模型的性能?
  • RQ5少量生成的虚拟实例是否能在不依赖大量真实数据的情况下显著提升零样本准确率?

主要发现

  • GLaP在三个基准数据集上均达到最先进性能,在使用视觉与语义特征的AwA数据集上准确率达到83.45%。
  • 与基线相比,该模型在AwA上的性能提升超过7%,当仅使用文本表征时,准确率达到81.29%。
  • 仅使用生成的虚拟实例(GLaP #1)即取得优异结果,在AwA上达到81.29%的准确率,优于基线方法。
  • 结合视觉与语义特征(A+W)表现最佳,在CUB数据集上相比单模态使用提升达25%。
  • 采用可见类别均值向量与生成实例的联合训练策略(GLaP #3)在性能上匹配或超过完整数据训练的结果。
  • 即使生成实例数量较少,性能依然强劲,表明所提方法具有高度的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。