Skip to main content
QUICK REVIEW

[论文解读] Open-World Visual Recognition Using Knowledge Graphs

Vincent Lonij, Ambrish Rawat|arXiv (Cornell University)|Aug 28, 2017
Domain Adaptation and Few-Shot Learning参考文献 22被引用 11
一句话总结

本文提出了一种基于知识图谱的开放世界视觉识别框架,通过将图像和实体联合嵌入共享语义空间,实现对未见类别的结构化关系(三元组)的零样本预测。通过引入平滑性约束和上下文感知注意力机制,该方法在基线模型基础上将视觉识别性能提升了六倍。

ABSTRACT

In a real-world setting, visual recognition systems can be brought to make predictions for images belonging to previously unknown class labels. In order to make semantically meaningful predictions for such inputs, we propose a two-step approach that utilizes information from knowledge graphs. First, a knowledge-graph representation is learned to embed a large set of entities into a semantic space. Second, an image representation is learned to embed images into the same space. Under this setup, we are able to predict structured properties in the form of relationship triples for any open-world image. This is true even when a set of labels has been omitted from the training protocols of both the knowledge graph and image embeddings. Furthermore, we append this learning framework with appropriate smoothness constraints and show how prior knowledge can be incorporated into the model. Both these improvements combined increase performance for visual recognition by a factor of six compared to our baseline. Finally, we propose a new, extended dataset which we use for experiments.

研究动机与目标

  • 解决在开放世界场景中进行视觉识别的挑战,即图像属于训练时未见过的类别,且无任何附加信息可用。
  • 实现对结构化语义关系(例如,'是一种哺乳动物')的预测,而不仅仅是对新视觉输入的类别标签。
  • 将知识图谱中的先验知识整合到视觉识别模型中,以提升泛化能力和可解释性。
  • 开发一种可自我更新的系统,能够利用视觉输入扩展知识图谱,模拟人类的持续学习能力。
  • 设计一个新的基准数据集,用于评估开放世界视觉识别和链接预测的性能。

提出的方法

  • 使用知识图谱嵌入方法(例如,TransE风格)学习联合嵌入空间,以在连续向量空间中表示实体和关系。
  • 训练一个深度卷积神经网络,将图像嵌入到相同的语义空间中,实现跨模态对齐。
  • 在图嵌入损失函数中引入平滑性约束,确保评分函数随输入变化而渐变,从而提升泛化能力。
  • 应用基于注意力的机制,通过聚焦知识图谱中的相关上下文,增强对新实体和关系的链接预测。
  • 使用上下文启发式方法,通过建模训练集中关系-尾部对的分布,提升对未见关系的预测能力。
  • 通过评分函数结合图像和实体嵌入,预测三元组(头,关系,尾)在语义空间中为真的可能性。

实验结果

研究问题

  • RQ1能否有效利用知识图谱嵌入,在训练时无任何关于新类别附加信息的开放世界设置中实现视觉识别?
  • RQ2嵌入空间中的平滑性约束如何提升零样本视觉识别任务的泛化能力和性能?
  • RQ3上下文感知注意力机制在多大程度上能增强从视觉输入预测新知识图谱链接的能力?
  • RQ4能否以系统化的方式利用视觉数据扩展知识图谱,实现持续学习和知识增长?
  • RQ5在标准、零样本和开放世界识别设置下,所提出方法与基线模型相比的性能表现如何?

主要发现

  • 所提方法在基线模型基础上将视觉识别性能提升了六倍,在开放世界识别任务中达到最先进水平。
  • 引入平滑性约束后,评分函数的Lipschitz常数从基线的0.645降低至0.174,表明函数平滑性与泛化能力显著提升。
  • 上下文感知注意力机制在SINTL数据集上提升性能,在开放世界设置下f@3得分从0.400提升至0.928。
  • 可视化结果表明,学习到的语义空间按类别(如动物、车辆)对实体进行聚类,并支持对关系的平滑、可解释的评分函数。
  • 该模型能够成功预测新类别图像的结构化属性(例如,'是一种哺乳动物'),即使这些类别在训练期间未被见过。
  • 该框架支持双向知识扩展:视觉输入可生成新的知识图谱边,而知识图谱结构可引导图像理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。