Skip to main content
QUICK REVIEW

[论文解读] MoSE: Modality Split and Ensemble for Multimodal Knowledge Graph Completion

Yu Zhao, Xiangrui Cai|arXiv (Cornell University)|Oct 17, 2022
Advanced Graph Neural Networks被引用 6
一句话总结

MoSE 提出了一种用于多模态知识图谱补全(MKGC)的模态分离表示学习与集成推理框架,通过按模态解耦关系嵌入以缓解模态层面的矛盾,并利用集成方法动态加权预测以反映模态特异性的重要性。实验表明,MoSE 在三个基准数据集上优于当前最先进方法,其中文本模态比视觉模态更具信息量。

ABSTRACT

Multimodal knowledge graph completion (MKGC) aims to predict missing entities in MKGs. Previous works usually share relation representation across modalities. This results in mutual interference between modalities during training, since for a pair of entities, the relation from one modality probably contradicts that from another modality. Furthermore, making a unified prediction based on the shared relation representation treats the input in different modalities equally, while their importance to the MKGC task should be different. In this paper, we propose MoSE, a Modality Split representation learning and Ensemble inference framework for MKGC. Specifically, in the training phase, we learn modality-split relation embeddings for each modality instead of a single modality-shared one, which alleviates the modality interference. Based on these embeddings, in the inference phase, we first make modality-split predictions and then exploit various ensemble methods to combine the predictions with different weights, which models the modality importance dynamically. Experimental results on three KG datasets show that MoSE outperforms state-of-the-art MKGC methods. Codes are available at https://github.com/OreOZhao/MoSE4MKGC.

研究动机与目标

  • 为解决多模态知识图谱补全(MKGC)中的模态层面矛盾问题,即不同模态(如文本与视觉)之间的冲突关系在共享单一关系嵌入时产生干扰。
  • 克服在预测中将所有模态同等对待的局限性,通过在推理过程中动态建模模态特异性重要性。
  • 提出一种新颖框架,在训练阶段解耦模态间紧密耦合的关系表示,并在推理阶段实现自适应融合。
  • 通过实证验证,文本模态在 MKGC 中提供的信息比视觉模态更可靠,尤其在关系预测方面。

提出的方法

  • 在训练阶段,MoSE 学习模态分离的关系嵌入,而非单一共享嵌入,从而减少模态之间的相互干扰。
  • 针对每种模态,MoSE 使用源自文本、视觉和知识图谱结构的实体与关系嵌入,分别进行独立的表示学习。
  • 在推理阶段,MoSE 使用模态分离嵌入生成各模态的独立预测。
  • 它应用多种集成策略——早期、晚期和自适应推理——利用可学习权重组合预测结果,以反映模态可靠性。
  • 自适应推理方法采用温度控制的软注意力机制,动态调整模态权重,并通过温度缩放实现置信度校准。
  • 该框架使用标准 MKGC 评估指标(MR、MRR、Hits@10)在三个数据集上进行评估:FB15K-237、WN18 和 WN9。

实验结果

研究问题

  • RQ1在多模态知识图谱补全中,解耦模态间的关系表示对性能有何影响?
  • RQ2与固定或共享融合策略相比,动态加权模态特异性预测是否能提升 MKGC 性能?
  • RQ3在 MKGC 中,哪种模态——文本或视觉——对实体预测的贡献更可靠?这种差异是否随关系类型而变化?
  • RQ4模态预测中的不确定性如何影响最终推理结果?能否通过温度缩放有效建模?

主要发现

  • MoSE 在所有三个基准数据集上均达到最先进性能:FB15K-237、WN18 和 WN9,优于 9 种基线方法。
  • 在 FB15K-237 上,MoSE 的 MRR 达到 0.448,Hits@10 达到 0.687,超越了先前的最先进方法 RSME。
  • 文本模态的贡献显著高于视觉模态,在 country_of_origin 关系案例中,文本模态的平均权重为 70%,而视觉模态为 0%。
  • 采用温度缩放的自适应推理方法(MoSE-AI)表现出更强的鲁棒性,随着温度从 0.5 增加到 32,性能趋于稳定并持续提升。
  • 案例研究证实,MoSE-BI 能够正确识别每种关系的高置信度模态,在文本提供更多信息时为其分配更高权重。
  • 视觉模态在不同数据集上表现不稳定,而文本模态始终能提升预测质量,尤其在需要上下文理解的关系中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。