Skip to main content
QUICK REVIEW

[论文解读] Multimodal Analogical Reasoning over Knowledge Graphs

Ningyu Zhang, Lei Li|arXiv (Cornell University)|Oct 1, 2022
Topic Modeling被引用 10
一句话总结

本文提出了一种在知识图谱上进行多模态类比推理的新方法,引入了一项新任务,整合视觉、文本和结构化知识以实现关系推理。提出了 MARS 数据集和 MarKG 知识图谱,并提出 MarT——一种受结构映射理论启发的模型无关 Transformer 框架,在无需显式关系监督的情况下实现了链接预测的最先进性能,展示了强大的泛化能力和多模态对齐能力。

ABSTRACT

Analogical reasoning is fundamental to human cognition and holds an important place in various fields. However, previous studies mainly focus on single-modal analogical reasoning and ignore taking advantage of structure knowledge. Notably, the research in cognitive psychology has demonstrated that information from multimodal sources always brings more powerful cognitive transfer than single modality sources. To this end, we introduce the new task of multimodal analogical reasoning over knowledge graphs, which requires multimodal reasoning ability with the help of background knowledge. Specifically, we construct a Multimodal Analogical Reasoning dataSet (MARS) and a multimodal knowledge graph MarKG. We evaluate with multimodal knowledge graph embedding and pre-trained Transformer baselines, illustrating the potential challenges of the proposed task. We further propose a novel model-agnostic Multimodal analogical reasoning framework with Transformer (MarT) motivated by the structure mapping theory, which can obtain better performance. Code and datasets are available in https://github.com/zjunlp/MKG_Analogy.

研究动机与目标

  • 为弥合多模态类比推理的空白,通过整合视觉、文本和知识图谱结构化信息来实现推理。
  • 开发一项新基准任务,将类比推理形式化为无需显式关系标注的链接预测。
  • 构建一个大规模、人工标注的数据集(MARS)和一个多模态知识图谱(MarKG),用于评估神经模型的类比推理能力。
  • 评估多模态知识图谱嵌入和预训练 Transformer 模型在新任务上的性能。
  • 提出 MarT,一种模型无关的框架,通过基于注意力的结构映射和端到端学习来增强类比推理能力。

提出的方法

  • 该任务被形式化为 $(e_h, e_t) : (e_q, ?)$,其中实体可以是多模态的(文本、图像或两者兼具),目标是利用 MarKG 中的背景知识预测缺失的目标实体。
  • MARS 数据集从 E-KAR 和 BATs 构建,通过 Wikidata 实体和 LAION-5B 中的图像进行增强,并由人工标注类比关系。
  • MarKG 是一个多模态知识图谱,整合了实体、关系以及模态特定的嵌入表示(文本、图像),用于推理。
  • MarT 采用基于 Transformer 的架构,通过注意力机制关注关系结构,并利用 [R] 标记实现隐式关系建模,实现多模态表示对齐。
  • 该框架具有模型无关性,可无缝集成到任意多模态预训练 Transformer 模型中(例如 VisualBERT、ViLT、FLAVA、MKGformer)。
  • 通过两种指标进行关系感知评估:预测 [R] 标记的 Hit@k 和归一化 [R] 表示与真实关系嵌入之间的欧氏距离。

实验结果

研究问题

  • RQ1神经网络能否利用结构化知识图谱背景,在多种模态(文本、图像)之间执行类比推理?
  • RQ2与单模态或非知识增强基线相比,多模态融合在多模态类比推理性能上有多大的提升?
  • RQ3端到端模型如 MarT 在无显式关系监督的情况下,能在多大程度上学习到关系结构?
  • RQ4多模态类比推理中的主要失败模式是什么?它们与模态不平衡或抽象概念有何关联?
  • RQ5在 MarKG 上进行预训练如何提升下游类比推理任务的性能?

主要发现

  • MarT 在 MARS 上优于所有基线模型,其中 MarT_FLAVA 在关系感知评估中表现最佳(Hits@3: 0.078,欧氏距离:1.380),而 MarT_MKGformer 在实体预测准确率上达到最高。
  • MPT 模型的性能与模型规模正相关,更大的混合流模型(如 MKGformer)优于更小的单流或双流模型。
  • 在 MarKG 上进行预训练显著提升了类比推理性能,所有 MPT 基线在预训练和微调阶段均表现出一致的性能增益。
  • [R] 标记的评估表明,MarT_FLAVA 最好地捕捉了关系语义(欧氏距离最低:1.380),尽管其在实体预测上表现不如 MarT_MKGformer。
  • 错误分析显示,模态不平衡、抽象概念(如“management”)以及非直观关系(如“intersection to”)是当前模型面临的主要挑战。
  • 一对多问题——即单个实体映射到多个有效目标——显著阻碍了模型的泛化能力,尤其在复杂关系场景中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。