Skip to main content
QUICK REVIEW

[论文解读] Generalized Zero-Shot Recognition based on Visually Semantic Embedding

Pengkai Zhu, Hanxiao Wang|arXiv (Cornell University)|Nov 19, 2018
Domain Adaptation and Few-Shot Learning参考文献 27被引用 9
一句话总结

本文提出了一种新颖的广义零样本学习(GZSL)方法,通过视觉语义嵌入来弥合视觉-语义鸿沟,将图像表示为学习到的原型部件类型的低维概率混合。该方法在基准数据集上,在语义和视觉监督下均优于最先进方法,其关键贡献在于提出了一种新型视觉预言机,可减少语义噪声并提升泛化能力。

ABSTRACT

We propose a novel Generalized Zero-Shot learning (GZSL) method that is agnostic to both unseen images and unseen semantic vectors during training. Prior works in this context propose to map high-dimensional visual features to the semantic domain, we believe contributes to the semantic gap. To bridge the gap, we propose a novel low-dimensional embedding of visual instances that is "visually semantic." Analogous to semantic data that quantifies the existence of an attribute in the presented instance, components of our visual embedding quantifies existence of a prototypical part-type in the presented instance. In parallel, as a thought experiment, we quantify the impact of noisy semantic data by utilizing a novel visual oracle to visually supervise a learner. These factors, namely semantic noise, visual-semantic gap and label noise lead us to propose a new graphical model for inference with pairwise interactions between label, semantic data, and inputs. We tabulate results on a number of benchmark datasets demonstrating significant improvement in accuracy over state-of-the-art under both semantic and visual supervision.

研究动机与目标

  • 为解决零样本学习中的视觉-语义鸿沟问题,即高维视觉特征缺乏语义可解释性。
  • 通过引入一种视觉预言机,提供更清晰的基于部件的监督,以降低噪声语义数据的影响。
  • 构建一个包含输入、标签和语义数据之间联合交互的三节点图模型,以提升推理性能。
  • 证明视觉语义嵌入在GZSL设置下优于传统语义监督。
  • 在语义和视觉监督下,于多个基准数据集上验证所提方法的有效性。

提出的方法

  • 提出一种视觉语义嵌入,将图像表示为低维概率矩阵,其中每个分量表示原型部件类型存在的可能性。
  • 使用多头注意力机制在训练集中学习一组有限的部件类型,实现解耦且可解释的视觉表征。
  • 引入一个三节点图模型,其中输入(X)、标签(Y)和语义(S)变量之间存在成对交互,区别于标准链式结构(X→S→Y)。
  • 设计一种视觉预言机,基于视觉特征提供真实部件类型可能性,作为比噪声语义属性更清晰的监督信号。
  • 采用结构化学习框架,联合学习部件特定特征与混合模型,以保持部件的空间与语义一致性。
  • 在语义和视觉监督下评估性能,并与强基线方法(如DEVISE)进行比较,以证明泛化能力。

实验结果

研究问题

  • RQ1低维、基于部件的视觉嵌入能否有效减少零样本学习中的视觉-语义鸿沟?
  • RQ2当用视觉预言机替代噪声语义监督时,GZSL模型的性能如何变化?
  • RQ3具有X-Y-S联合交互的三节点图模型在多大程度上优于链式结构模型?
  • RQ4视觉语义嵌入在广义零样本设置下能否在已见和未见类别上均实现良好泛化?
  • RQ5所提方法在语义和视觉监督下是否均优于最先进GZSL方法?

主要发现

  • 所提出的视觉语义嵌入通过学习与语义属性评分相匹配的部件类型可能性,显著减少了视觉-语义鸿沟。
  • 在CUB数据集上,使用视觉监督时,该方法在调和平均准确率上相比基线实现了12.8%的绝对提升。
  • 在AWA2数据集上,当使用视觉监督重新训练DEVISE基线时,该方法在调和平均准确率上实现了13.4%的绝对提升。
  • 结构化的视觉嵌入优于平坦的全局特征表示,表明部件级结构对性能至关重要。
  • 视觉预言机在多个数据集和模型上持续提升GZSL性能,表明语义噪声是现有方法中的关键瓶颈。
  • 具有完整成对交互的三节点图模型在推理性能上优于链式结构模型,证实了联合建模标签-语义-输入的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。