Skip to main content
QUICK REVIEW

[论文解读] Visual Pivoting for (Unsupervised) Entity Alignment

Fangyu Liu, Muhao Chen|arXiv (Cornell University)|Sep 28, 2020
Topic Modeling被引用 7
一句话总结

本文提出EVA,一种新颖的无监督实体对齐方法,通过知识图谱中的视觉表征来构建初始种子对齐(视觉枢纽),无需人工标注标签。通过可学习注意力机制融合图像、结构、关系和属性信息,EVA在DBP15k和DWY15k上取得最先进性能,尤其在对结构上下文稀疏的长尾实体对齐方面表现卓越。

ABSTRACT

This work studies the use of visual semantic representations to align entities in heterogeneous knowledge graphs (KGs). Images are natural components of many existing KGs. By combining visual knowledge with other auxiliary information, we show that the proposed new approach, EVA, creates a holistic entity representation that provides strong signals for cross-graph entity alignment. Besides, previous entity alignment methods require human labelled seed alignment, restricting availability. EVA provides a completely unsupervised solution by leveraging the visual similarity of entities to create an initial seed dictionary (visual pivots). Experiments on benchmark data sets DBP15k and DWY15k show that EVA offers state-of-the-art performance on both monolingual and cross-lingual entity alignment tasks. Furthermore, we discover that images are particularly useful to align long-tail KG entities, which inherently lack the structural contexts necessary for capturing the correspondences.

研究动机与目标

  • 通过利用视觉相似性作为无监督监督信号,解决实体对齐中种子对齐稀缺的问题。
  • 提升在知识图谱中缺乏足够结构上下文的长尾实体的对齐性能。
  • 构建一种整体性的多模态实体表征,整合视觉、结构和属性信息,以提升跨图对齐效果。
  • 证明视觉模态可作为多语言和单语言知识图谱中实体对齐的通用、语言无关信号。
  • 通过消融研究和错误分析,提升多模态融合的可解释性,分析各模态的贡献度。

提出的方法

  • EVA通过可学习注意力机制,融合视觉、结构、关系和属性特征,构建联合实体表征,动态根据相关性加权各模态。
  • 该方法提出视觉枢纽机制:通过测量跨知识图谱中实体间的视觉相似性,自动识别种子对齐,实现完全无监督的训练设置。
  • 在半监督和无监督设置中,应用迭代学习(il)逐步扩展初始种子词典,多轮迭代提升对齐质量。
  • 采用多模态对比学习目标,在训练过程中对齐跨图实体,同时保留各模态的特异性表征。
  • 模型通过对比损失和对齐损失联合端到端训练,注意力权重提供对各模态贡献度的可解释性。
  • 该方法在两个基准数据集上进行评估:DBP15k(跨语言)和DWY15k(单语言),并开展模态重要性消融研究和视觉表征稳定性错误分析。

实验结果

研究问题

  • RQ1实体间的视觉相似性能否作为生成初始种子对齐的可靠无监督信号?
  • RQ2整合视觉表征在多大程度上提升对齐性能,特别是在结构上下文有限的长尾实体上?
  • RQ3完全无监督的EVA模型在性能上与依赖真实种子对齐的半监督基线模型相比如何?
  • RQ4不同模态(视觉、结构、关系、属性)对最终对齐性能的贡献如何?其相对重要性能否通过注意力权重进行解释?
  • RQ5视觉表征的失败模式是什么?不一致或不稳定的视觉特征如何影响对齐准确率?

主要发现

  • EVA在DBP15k(跨语言)和DWY15k(单语言)两个基准上均达到最先进性能,在半监督和无监督设置下均优于先前方法。
  • 无监督版本的EVA准确率超过70%,与半监督版本性能接近,且超越了此前最佳半监督基线。
  • 在DBP15k(FR→EN)基准中,EVA结合视觉特征将长尾实体Stade_olympique_de_Munich的正确实体Olympiastadion_(Munich)排在首位,而无视觉特征的版本未能实现这一点。
  • 对于结构邻居少于三个的长尾实体,视觉表征显著提升对齐准确率,因其在结构上下文薄弱时提供稳定且具体的信号。
  • 消融研究显示,视觉模态对对齐性能贡献最大,尤其在低资源场景下,注意力权重成功揭示了视觉特征的重要性。
  • 错误分析表明,在跨语言设置中,剩余错误的2/3源于缺失或不一致的图像,且60%的含图像错误源于视觉表征不一致,尤其在抽象或符号密集型实体上更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。