Skip to main content
QUICK REVIEW

[论文解读] Cross-modal Hallucination for Few-shot Fine-grained Recognition

Frederik Pahde, Patrick Jähnichen|arXiv (Cornell University)|Jun 13, 2018
Domain Adaptation and Few-Shot Learning参考文献 26被引用 16
一句话总结

本文提出了一种用于少样本细粒度图像识别的跨模态幻觉框架,通过使用判别性文本条件生成对抗网络(tcGAN)从文本描述生成类别判别性图像。通过利用多模态训练数据(图像与文本)并应用基于类别判别性判别器的自步策略,该方法在CUB数据集上相比单模态基线模型,将少样本准确率提升了4.9至8.6个百分点。

ABSTRACT

State-of-the-art deep learning algorithms generally require large amounts of data for model training. Lack thereof can severely deteriorate the performance, particularly in scenarios with fine-grained boundaries between categories. To this end, we propose a multimodal approach that facilitates bridging the information gap by means of meaningful joint embeddings. Specifically, we present a benchmark that is multimodal during training (i.e. images and texts) and single-modal in testing time (i.e. images), with the associated task to utilize multimodal data in base classes (with many samples), to learn explicit visual classifiers for novel classes (with few samples). Next, we propose a framework built upon the idea of cross-modal data hallucination. In this regard, we introduce a discriminative text-conditional GAN for sample generation with a simple self-paced strategy for sample selection. We show the results of our proposed discriminative hallucinated method for 1-, 2-, and 5- shot learning on the CUB dataset, where the accuracy is improved by employing multimodal data.

研究动机与目标

  • 为解决细粒度视觉识别中训练数据有限的问题,特别是在仅提供每类1–5个样本的新类别情况下的少样本场景。
  • 通过在训练过程中利用多模态数据(图像与细粒度文本描述),弥合基础类别与新类别之间的信息鸿沟。
  • 通过生成高质量、类别判别性的图像(基于文本描述条件),即使真实图像稀缺,也能提升少样本学习性能。
  • 开发一种自步样本选择策略,优先选择基于类别判别性质量而非仅真实感的生成图像。
  • 建立一个新的多模态少样本学习基准,其在训练时为多模态(图像与文本),但在推理时为单模态(仅图像)。

提出的方法

  • 训练一个判别性文本条件生成对抗网络(tcGAN),以生成基于文本描述的图像,其中生成器学习生成既逼真又具备类别判别性的样本。
  • 修改判别器,使其具备类别判别性(D*)而非仅区分真实与虚假样本,从而更有效地筛选出能捕捉新类别独特特征的生成样本。
  • 采用自步学习策略,根据类别判别性判别器D*的置信度分数对生成样本进行排序,仅选择最具判别性的图像用于训练。
  • 最终分类器在真实少样本图像与排名靠前的幻觉图像组合上进行训练,从而在低数据环境下提升泛化能力。
  • 框架使用预训练的文本编码器对文本描述进行嵌入,并在训练过程中通过对比学习将文本特征与视觉特征对齐。
  • 实验在CUB-200-2011数据集上进行,包含150个基础类别与50个新类别,每类新类别使用1–20张样本。

实验结果

研究问题

  • RQ1与单模态基线相比,使用文本条件GAN进行跨模态幻觉是否能提升少样本细粒度图像识别性能?
  • RQ2使用类别判别性判别器(D*)进行样本选择,是否比使用标准真实/虚假判别器具有更好的泛化能力?
  • RQ3多模态数据(图像与文本)在少样本学习中能在多大程度上弥补新类别真实图像的缺失?
  • RQ4基于类别判别性分数选择幻觉样本的自步策略,在提升模型鲁棒性方面有多有效?
  • RQ5所提出的框架是否能超越仅依赖图像数据或零样本生成的现有少样本学习方法?

主要发现

  • 所提方法(StGD*)在1-shot学习中达到28.5%的top-5准确率,相比单模态基线(19.9%)提升了8.6个百分点。
  • 在2-shot学习中,该方法达到31.6%的top-5准确率,相比基线(24.8%)提升了6.8个百分点。
  • 在5-shot学习中,该方法达到41.7%的top-5准确率,相比基线(36.8%)提升了4.9个百分点。
  • 与仅基于真实感排序的基线方法(StGD)相比,使用类别判别性判别器(D*)显著提升了性能。
  • 定性分析表明,D*高分排序的图像包含更多类别判别性特征,而仅由D排序的图像尽管逼真,却常出现类别混淆。
  • 结果表明,多模态数据与判别性样本选择在弥合少样本细粒度识别中的信息鸿沟方面至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。