Skip to main content
QUICK REVIEW

[论文解读] Learning to Infer Unseen Single-/Multi-Attribute-Object Compositions with Graph Networks

Hui Chen, Jiang, Jingjing|arXiv (Cornell University)|Oct 27, 2020
Domain Adaptation and Few-Shot Learning参考文献 50被引用 7
一句话总结

该论文提出了一种基于图神经网络的模型,通过将视觉特征与词嵌入标签映射到共享潜在空间,实现对未见单属性和多属性物体组合的推理,其中组合识别通过语义距离最小化完成。该方法在未见组合上实现了最先进性能,尤其在区分视觉上相似的组合方面表现优异,并提出了一个包含116,099张图像和8,030个类别的新型多属性数据集(MAD)。

ABSTRACT

Inferring the unseen attribute-object composition is critical to make machines learn to decompose and compose complex concepts like people. Most existing methods are limited to the composition recognition of single-attribute-object, and can hardly learn relations between the attributes and objects. In this paper, we propose an attribute-object semantic association graph model to learn the complex relations and enable knowledge transfer between primitives. With nodes representing attributes and objects, the graph can be constructed flexibly, which realizes both single- and multi-attribute-object composition recognition. In order to reduce mis-classifications of similar compositions (e.g., scratched screen and broken screen), driven by the contrastive loss, the anchor image feature is pulled closer to the corresponding label feature and pushed away from other negative label features. Specifically, a novel balance loss is proposed to alleviate the domain bias, where a model prefers to predict seen compositions. In addition, we build a large-scale MultiAttribute Dataset (MAD) with 116,099 images and 8,030 label categories for inferring unseen multi-attribute-object compositions. Along with MAD, we propose two novel metrics Hard and Soft to give a comprehensive evaluation in the multi-attribute setting. Experiments on MAD and two other single-attribute-object benchmarks (MIT-States and UT-Zappos50K) demonstrate the effectiveness of our approach.

研究动机与目标

  • 解决在训练期间未见过的属性-物体组合识别挑战,特别是当组合具有相似视觉外观时。
  • 使用图结构表示建模属性与物体之间的相互依赖性,以捕捉语义关系。
  • 通过学习抽象属性的内在特征表示及其与物体的组合,提升零样本泛化能力。
  • 构建一个大规模、多样化的数据集(MAD),以支持多属性组合识别研究。
  • 实现在真实视觉理解任务中对复杂、未见属性-物体组合的灵活且可扩展的识别。

提出的方法

  • 模型使用图卷积网络(GCN)将图像视觉特征和属性-物体标签嵌入(通过预训练的word2vec)映射到共享潜在空间。
  • 引入一种组合聚类机制,以压缩相同组合的特征并增大潜在空间中不同组合之间的距离。
  • GCN的邻接矩阵通过端到端学习并结合稀疏正则化,以捕捉属性-物体对之间的有意义语义相关性。
  • 推理通过在潜在空间中寻找与图像特征余弦距离最近的语义嵌入组合来完成。
  • 模型使用类似Siamese的对比损失,以促进同一组合内部的紧凑性和不同组合之间的分离性。
  • 该方法在新构建的大规模数据集(MAD)上进行训练,并在三个基准数据集上进行评估:MIT-States、UT-Zappos50K和MAD。

实验结果

研究问题

  • RQ1基于图的模型能否通过利用属性与物体之间学习到的语义关系,有效识别未见的属性-物体组合?
  • RQ2该模型在区分视觉上相似的组合(如“切片番茄”和“切片苹果”)方面表现如何?
  • RQ3图结构在在多大程度上捕捉了有意义的、未标注的属性-物体相关性(例如“自来水笔”和“圆珠笔”)?
  • RQ4与单属性基线方法相比,该模型在多属性组合上的泛化能力如何?
  • RQ5架构选择(如批量大小、深度)对模型性能和鲁棒性有何影响?

主要发现

  • 所提出的模型在未见组合识别任务上实现了最先进性能,在MAD数据集的闭集划分上达到33.3%的top-1准确率,在开集划分上达到16.0%。
  • 该模型在MIT-States和UT-Zappos50K上显著优于基线方法,尤其在处理视觉模糊组合方面表现突出。
  • t-SNE可视化结果证实,组合聚类机制能有效将同一组合的特征聚类,并增大不同组合之间的距离。
  • 学习到的邻接矩阵揭示了有意义的、不可训练的相关性——例如,“杂乱的”与“绳子”之间存在关联,即使没有相关训练样本——表明模型具备推断语义关系的能力。
  • 该模型对深度和批量大小具有鲁棒性,性能在3–4层GCN时达到峰值,并在不同批量大小下保持稳定。
  • 消融实验表明,图结构和组合聚类机制对性能均至关重要,尤其在区分相似组合方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。