Skip to main content
QUICK REVIEW

[论文解读] Episode-based Prototype Generating Network for Zero-Shot Learning

Yunlong Yu, Zhong Ji|arXiv (Cornell University)|Sep 8, 2019
Domain Adaptation and Few-Shot Learning参考文献 43被引用 15
一句话总结

该论文提出了一种基于任务的原型生成网络(E-PGN),用于零样本学习,通过在训练过程中模拟虚假的零样本任务,以提升模型对真实未见类别的泛化能力。通过基于语义嵌入生成视觉原型,并采用参数高效的多模态交叉熵损失,E-PGN在四种基准数据集的传统与广义零样本学习设置下均取得了最先进性能。

ABSTRACT

We introduce a simple yet effective episode-based training framework for zero-shot learning (ZSL), where the learning system requires to recognize unseen classes given only the corresponding class semantics. During training, the model is trained within a collection of episodes, each of which is designed to simulate a zero-shot classification task. Through training multiple episodes, the model progressively accumulates ensemble experiences on predicting the mimetic unseen classes, which will generalize well on the real unseen classes. Based on this training framework, we propose a novel generative model that synthesizes visual prototypes conditioned on the class semantic prototypes. The proposed model aligns the visual-semantic interactions by formulating both the visual prototype generation and the class semantic inference into an adversarial framework paired with a parameter-economic Multi-modal Cross-Entropy Loss to capture the discriminative information. Extensive experiments on four datasets under both traditional ZSL and generalized ZSL tasks show that our model outperforms the state-of-the-art approaches by large margins.

研究动机与目标

  • 通过在训练过程中模拟零样本任务,解决零样本学习中已见类别与未见类别之间的泛化差距问题。
  • 通过基于类别语义条件生成的原型,改善零样本分类中的视觉-语义对齐。
  • 开发一种参数高效的分类模块,整合视觉、语义和类别标签信息,且无需额外参数。
  • 缓解现有生成式零样本学习方法中常见的类别不平衡偏移与模式崩溃问题。
  • 建立一种稳健的训练范式,通过迭代式任务学习逐步提升模型适应能力。

提出的方法

  • 该模型采用基于任务的训练框架,每个任务将训练数据划分为支持集和优化集,以模拟零样本任务。
  • 一个原型生成网络(PGN)在对抗性框架中,利用两个生成器和一个判别器,从类别语义原型合成视觉原型。
  • 该方法引入一种多模态交叉熵(MCE)损失,通过单一分类头联合优化视觉特征、语义原型和类别标签,且不增加额外参数。
  • 对抗性训练通过区分真实与虚假的视觉-语义对,对齐视觉与语义空间,增强特征一致性。
  • 模型通过对抗损失、视觉与语义重建的回归损失以及MCE损失的组合进行端到端训练。
  • 推理阶段采用基于距离的分类方法,使用欧氏距离,消融实验表明其性能优于余弦距离。

实验结果

研究问题

  • RQ1基于任务的训练范式是否能提升模型在零样本学习中对未见类别的泛化能力?
  • RQ2能否有效从语义原型生成视觉原型,以弥合已见与未见类别之间的领域差距?
  • RQ3参数经济的多模态交叉熵损失是否能在不增加模型复杂度的前提下提升分类准确率?
  • RQ4不同距离度量(欧氏距离与余弦距离)对零样本分类性能有何影响?
  • RQ5E-PGN模型的各个组件如何共同贡献于整体性能?

主要发现

  • E-PGN在四个基准数据集上均取得最先进性能,广义零样本学习设置下在FLO数据集上达到76.5%的top-1准确率。
  • 包含所有组件(对抗损失、两个回归损失和MCE损失)的模型在16项指标中的14项上表现最佳,表明各组件具有互补优势。
  • 消融研究显示,移除MCE损失后,四组数据集中有三组性能显著下降,凸显其在分类准确率中的关键作用。
  • 采用MCE损失的模型在AwA1、AwA2和CUB数据集上优于基线的交叉熵损失,在FLO数据集上表现相当,证实了多模态损失的有效性。
  • 欧氏距离在所有数据集上均持续优于余弦距离,表明其更适合本框架。
  • 基于任务的训练范式使模型能够逐步积累对模拟未见类别的预测经验,从而在真实未见类别上实现强大泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。