Skip to main content
QUICK REVIEW

[论文解读] KG-SP: Knowledge Guided Simple Primitives for Open World Compositional Zero-Shot Learning

Shyamgopal Karthik, Massimiliano Mancini|arXiv (Cornell University)|May 13, 2022
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

KG-SP 通过使用独立的非线性特征提取器分别预测物体和状态标签,并利用外部知识(ConceptNet)过滤不合理的组合,提出了一种知识引导的开放世界组合零样本学习方法。该方法在 OW-CZSL 和一种新型的 pCZSL 设置下均实现了最先进性能,其中训练期间仅提供部分监督信息。

ABSTRACT

The goal of open-world compositional zero-shot learning (OW-CZSL) is to recognize compositions of state and objects in images, given only a subset of them during training and no prior on the unseen compositions. In this setting, models operate on a huge output space, containing all possible state-object compositions. While previous works tackle the problem by learning embeddings for the compositions jointly, here we revisit a simple CZSL baseline and predict the primitives, i.e. states and objects, independently. To ensure that the model develops primitive-specific features, we equip the state and object classifiers with separate, non-linear feature extractors. Moreover, we estimate the feasibility of each composition through external knowledge, using this prior to remove unfeasible compositions from the output space. Finally, we propose a new setting, i.e. CZSL under partial supervision (pCZSL), where either only objects or state labels are available during training, and we can use our prior to estimate the missing labels. Our model, Knowledge-Guided Simple Primitives (KG-SP), achieves state of the art in both OW-CZSL and pCZSL, surpassing most recent competitors even when coupled with semi-supervised learning techniques. Code available at: https://github.com/ExplainableML/KG-SP.

研究动机与目标

  • 为解决开放世界组合零样本学习(OW-CZSL)中的挑战,即模型必须在未见过的组合空间中识别未见过的状态-物体组合,且事先不了解组合空间。
  • 通过利用外部知识进行可行性过滤,减少有效输出空间,从而提升 OW-CZSL 中的泛化能力。
  • 提出并评估一种新设置:部分监督下的 CZSL(pCZSL),即在训练期间仅提供物体或状态标签。
  • 证明独立预测基本元素并结合知识引导过滤,相较于联合组合建模,在 OW-CZSL 和 pCZSL 中均表现更优。
  • 验证基于 ConceptNet 的可行性分数在提升零样本泛化能力和弱监督设置下的伪标签质量方面的有效性。

提出的方法

  • KG-SP 使用两个独立的非线性特征提取器分别处理物体和状态识别,实现任务特定的特征学习,避免共享表示。
  • 在推理阶段,模型独立预测物体和状态标签,通过将搜索空间从所有组合缩减为单个基本元素,从而简化问题。
  • 利用 ConceptNet 估算每个状态-物体组合的可行性,推理时从输出空间中过滤掉低分、不合理的组合对。
  • 在 pCZSL 设置中,由于训练期间仅提供物体或状态标签,KG-SP 利用可行性分数为缺失模态生成伪标签。
  • 该方法在推理和训练阶段均应用知识引导的过滤,提升了零样本泛化中的鲁棒性与准确性。
  • 该框架兼容半监督学习,实验表明,即使与此类技术结合,其性能仍优于近期基线方法。

实验结果

研究问题

  • RQ1独立预测物体和状态基本元素,并结合基于知识的可行性过滤,是否能在开放世界 CZSL 中超越联合组合建模?
  • RQ2外部知识(ConceptNet)在过滤不合理的状态-物体组合方面有多有效,能否提升零样本识别性能?
  • RQ3所提出的方法能否泛化到新型的 pCZSL 设置中,即在训练期间仅提供部分监督(物体或状态标签)?
  • RQ4知识引导的过滤是否能提升弱监督训练中伪标签的质量,从而在 pCZSL 中取得更好性能?
  • RQ5在组合复杂度较高的设置下,KG-SP 与最先进方法相比,在零样本泛化能力方面表现如何?

主要发现

  • KG-SP 在 OW-CZSL 基准上实现了最先进性能,即使在近期方法使用半监督学习技术的情况下也表现更优。
  • 通过使用基于 ConceptNet 的可行性分数过滤不合理的组合,模型显著提升了零样本识别准确率,有效缩小了输出空间。
  • 在 pCZSL 设置中,KG-SP 超过近期方法,证明了知识引导的伪标签在缺失模态预测中的有效性。
  • 使用独立的特征提取器处理物体和状态,相比共享表示,能获得更优的特征学习效果,因为两类任务依赖不同的视觉线索。
  • 定性分析表明,ConceptNet 的可行性分数与现实世界合理性高度一致,能正确识别常见组合(如明亮郁金香、焦糖化糖)并排除不合理组合(如冒热气的手镯)。
  • 尽管性能表现优异,但 OW-CZSL 基准上的绝对准确率仍较低(例如,C-GQA 上未见组合准确率为 2.9%),凸显了该任务的固有难度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。