Skip to main content
QUICK REVIEW

[论文解读] Knowledge Graph Completion with Pre-trained Multimodal Transformer and Twins Negative Sampling

Yichi Zhang, Wen Zhang|arXiv (Cornell University)|Sep 15, 2022
Advanced Graph Neural Networks被引用 7
一句话总结

该论文提出VBKGC,一种基于嵌入的知识图谱补全模型,利用VisualBERT在不微调的情况下提取深层多模态特征,实现快速推理。该模型引入孪生负采样策略,对齐结构化与多模态实体嵌入,在多模态知识图谱上显著提升链接预测性能,尤其在WN9数据集上,其在所有指标上均优于现有基线模型。

ABSTRACT

Knowledge graphs (KGs) that modelings the world knowledge as structural triples are inevitably incomplete. Such problems still exist for multimodal knowledge graphs (MMKGs). Thus, knowledge graph completion (KGC) is of great importance to predict the missing triples in the existing KGs. As for the existing KGC methods, embedding-based methods rely on manual design to leverage multimodal information while finetune-based approaches are not superior to embedding-based methods in link prediction. To address these problems, we propose a VisualBERT-enhanced Knowledge Graph Completion model (VBKGC for short). VBKGC could capture deeply fused multimodal information for entities and integrate them into the KGC model. Besides, we achieve the co-design of the KGC model and negative sampling by designing a new negative sampling strategy called twins negative sampling. Twins negative sampling is suitable for multimodal scenarios and could align different embeddings for entities. We conduct extensive experiments to show the outstanding performance of VBKGC on the link prediction task and make further exploration of VBKGC.

研究动机与目标

  • 解决现有知识图谱补全方法在有效利用多模态信息方面的局限性。
  • 克服基于微调的模型在多模态知识图谱补全中推理速度慢与性能欠佳的问题。
  • 协同设计模型架构与负采样策略,以改善结构化与多模态嵌入的对齐。
  • 开发一种通用的端到端方法,避免为多模态实体手动设计特征融合。
  • 证明孪生负采样通过对齐不同嵌入空间,可提升多模态场景下的性能。

提出的方法

  • VBKGC采用VisualBERT作为预训练的多模态Transformer编码器,无需微调即可为实体提取深度融合的视觉-文本特征。
  • 该模型使用由多个组件组成的评分函数:$τ_{ss}$、$τ_{mm}$、$τ_{sm}$ 和 $τ_{ms}$,分别捕捉结构、多模态及跨模态交互。
  • 引入孪生负采样作为协同设计的训练策略,通过配对来自不同模态的嵌入生成负样本,以改善对齐效果。
  • 该方法通过聚焦于嵌入级对齐,避免了实体级负采样,在多模态设置中尤为有效。
  • 模型采用基于边距的损失函数结合负采样进行训练,其中孪生负采样增强了多模态与结构化表示的对比学习。
  • 由于使用了冻结的VisualBERT与轻量级评分函数,推理过程高效,预测速度可与传统嵌入模型相媲美。

实验结果

研究问题

  • RQ1预训练的多模态Transformer(如VisualBERT)能否在不微调的情况下有效提取知识图谱中实体的统一多模态表示?
  • RQ2将模型与新型负采样策略协同设计,是否能提升多模态知识图谱补全中的链接预测性能?
  • RQ3在不同数据集上,孪生负采样与标准负采样在对齐结构化与多模态嵌入方面有何差异?
  • RQ4在不同多模态知识图谱设置中,负样本数量对孪生负采样性能的影响如何?
  • RQ5与基于嵌入和基于微调的基线模型相比,VBKGC在推理速度与准确率之间如何权衡?

主要发现

  • 在WN9数据集上,VBKGC达到SOTA性能,MRR为0.299,Hit@10为0.477,Hit@3为0.331,Hit@1为0.210,所有指标均优于现有基线模型。
  • 在FB15K-237数据集上,VBKGC的MRR为0.299,尽管在高负样本数量下孪生负采样带来的性能增益较小,但依然表现出强泛化能力。
  • 在WN9上,孪生负采样显著提升性能,即使在低负样本数量($k=1$)下也优于普通负采样,表明其具备高效的嵌入对齐能力。
  • 消融实验表明,若移除VisualBERT(S1),MRR降至0.226,证明深度多模态特征提取的必要性。
  • 消融实验显示,仅使用完整评分函数($τ_{all}$)或多模态组件($τ_{sm} + τ_{ms}$)的结果优于仅使用结构或单模态得分,凸显跨模态交互的重要性。
  • VBKGC实现快速推理速度,与TransE和IKRL等传统嵌入模型相当,且显著快于KG-BERT和StAR等基于微调的模型,同时保持了更优的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。