Skip to main content
QUICK REVIEW

[论文解读] Answering Visual-Relational Queries in Web-Extracted Knowledge Graphs

Daniel Oñoro-Rubio, Mathias Niepert|arXiv (Cornell University)|Sep 7, 2017
Multimodal Machine Learning Applications参考文献 62被引用 10
一句话总结

本文提出了ImageGraph,一个从网络中提取的视觉关系知识图谱,包含14,870个实体、1,330种关系和829,931张图像,并提出了一种新颖的神经架构,将卷积神经网络与知识图谱嵌入相结合,以回答复杂的视觉关系查询。主要贡献在于一种联合模型,通过将图像视为知识图谱中的第一类实体,实现了准确、高效的多关系图像检索和零样本视觉关系预测,在未见图像定位任务上表现优异。

ABSTRACT

A visual-relational knowledge graph (KG) is a multi-relational graph whose entities are associated with images. We explore novel machine learning approaches for answering visual-relational queries in web-extracted knowledge graphs. To this end, we have created ImageGraph, a KG with 1,330 relation types, 14,870 entities, and 829,931 images crawled from the web. With visual-relational KGs such as ImageGraph one can introduce novel probabilistic query types in which images are treated as first-class citizens. Both the prediction of relations between unseen images as well as multi-relational image retrieval can be expressed with specific families of visual-relational queries. We introduce novel combinations of convolutional networks and knowledge graph embedding methods to answer such queries. We also explore a zero-shot learning scenario where an image of an entirely new entity is linked with multiple relations to entities of an existing KG. The resulting multi-relational grounding of unseen entity images into a knowledge graph serves as a semantic entity representation. We conduct experiments to demonstrate that the proposed methods can answer these visual-relational queries efficiently and accurately.

研究动机与目标

  • 为解决视觉关系知识图谱中实体关联图像、关系在视觉数据上学习的研究不足问题。
  • 支持将图像作为知识图谱中第一类实体的新查询类型,如多关系图像检索和视觉链接预测。
  • 开发一种联合深度学习框架,结合卷积神经网络与知识图谱嵌入方法,实现概率性视觉关系推理。
  • 通过将未见过的实体图像基于视觉相似性和关系结构嵌入现有知识图谱,探索零样本学习方法。
  • 在域内与零样本视觉关系查询回答任务上,评估所提模型的有效性。

提出的方法

  • 构建了ImageGraph,一个大规模从网络中提取的视觉关系知识图谱,包含1,330种关系类型、14,870个实体和829,931张从网络收集的图像。
  • 提出一种联合神经架构,通过拼接(CAT)和逐元素相乘等操作,将预训练CNN的图像嵌入与知识图谱嵌入向量相结合。
  • 设计了一种得分函数,通过学习到的操作将图像嵌入与特定关系的向量组合,实现通过预计算图像嵌入实现高效的查询回答。
  • 在最后一层使用负采样和Sigmoid激活函数,以提升在长尾分布知识图谱上的训练稳定性和性能。
  • 将零样本学习形式化为视觉定位问题:仅在推理时使用视觉特征,预测未见过图像与现有知识图谱实体之间的关系。
  • 在零样本设置中,通过多个图像样本的平均概率实现稳健的关系排序,尤其针对第(4)类查询(目标实体已知)具有优势。

实验结果

研究问题

  • RQ1视觉关系知识图谱是否能支持图像作为知识图谱中第一类实体的新型概率查询?
  • RQ2与基线方法相比,联合CNN-KGE模型在多关系图像检索和视觉链接预测查询上的表现如何?
  • RQ3深度神经网络是否能在零样本设置下泛化至预测未见过图像与现有知识图谱实体之间的关系?
  • RQ4所提出的架构在具有长尾实体与关系分布的视觉关系查询上,相较于标准链接预测基线方法,优势有多大?
  • RQ5通过多关系链接将未见过图像嵌入知识图谱的视觉定位,是否可作为有效的零样本学习策略?

主要发现

  • CAT-SIG模型(即图像嵌入与关系嵌入拼接后经Sigmoid激活输出层)在所有指标上表现最佳,在中位排名和hits@100上均优于基线模型。
  • 通过预计算图像嵌入,仅在查询时进行评分,该模型在单个多关系图像检索查询上仅耗时90ms,避免了613,138次独立查询。
  • 在零样本关系预测中,CAT模型显著优于基线,即使在关系与实体分布严重不均衡的情况下,仍展现出对未见实体的良好泛化能力。
  • 该模型成功将正确关系排在前3名,适用于4个示例查询中的2个,并在2个具有挑战性的案例中正确识别出最高分关系,显示出在视觉定位中的稳健性。
  • 结果证实,通过多关系链接实现视觉定位是零样本学习的一种可行且有效方法,可在无训练数据的情况下实现对全新视觉概念的推理。
  • 联合CNN-KGE模型泛化能力出色,在性能上与域内关系预测相当(见表2),表明其具备强大的迁移学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。