Skip to main content
QUICK REVIEW

[论文解读] Knowledge Fusion via Embeddings from Text, Knowledge Graphs, and Images

Steffen Thoma, Achim Rettinger|arXiv (Cornell University)|Apr 20, 2017
Topic Modeling参考文献 20被引用 5
一句话总结

本文提出了一种三模态知识融合框架,通过词级对齐将文本、视觉和知识图谱嵌入整合到共享概念空间中。通过在DBpedia上融合预训练的word2vec、Inception-V3和TransE模型的表示,该方法在词相似度基准测试中表现出色,表明多模态融合相比单模态或双模态方法能产生更接近人类的语义表征。

ABSTRACT

We present a baseline approach for cross-modal knowledge fusion. Different basic fusion methods are evaluated on existing embedding approaches to show the potential of joining knowledge about certain concepts across modalities in a fused concept representation.

研究动机与目标

  • 探究结合文本、视觉和知识图谱嵌入是否能提升概念表征质量。
  • 评估共享跨模态嵌入空间是否比单模态或双模态表征更符合人类对概念相似性的认知。
  • 开发一种可扩展的方法,实现在词级别对三种不同模态的异质嵌入进行对齐与融合。
  • 证明不同模态间信息的互补性,以捕捉更丰富、更全面的概念表征。

提出的方法

  • 使用预训练的word2vec嵌入表示文本,Inception-V3特征表示视觉,自训练的TransE嵌入表示知识图谱中的概念。
  • 通过将DBpedia概念映射到其最常见的表面形式,并使用最大池化聚合每个WordNet同义词集的ImageNet图像特征,实现在词级别的模态对齐。
  • 通过拼接来自文本、图像和知识图谱的词级别对齐表示,构建共享的三模态嵌入空间。
  • 采用两步对齐过程:首先,通过WordNet将知识图谱实体和图像特征映射到共同的词级别概念;其次,将对齐后的嵌入融合为单一联合表征。
  • 利用WordNet的层次结构创建抽象概念表征(例如,将'小提琴'和'竖琴'合并表示'乐器')。
  • 在标准的人工标注词相似度数据集上评估融合后的嵌入,以衡量其与人类感知的一致性。

实验结果

研究问题

  • RQ1三者融合的文本、视觉和知识图谱嵌入是否能产生比单模态或双模态方法更全面、更接近人类的语义表征?
  • RQ2视觉和知识图谱嵌入在捕捉概念相似性方面,对文本词嵌入的贡献有多大程度的互补性?
  • RQ3在模态之间实现词级别对齐,在构建统一的共享嵌入空间以进行概念表征方面有多有效?
  • RQ4与单一模态或成对模态相比,包含全部三种模态是否能带来可测量的词相似度基准性能提升?

主要发现

  • 融合的三模态表征在标准词相似度基准测试中始终优于单模态和双模态表征,证实了多模态融合可增强概念表征的假设。
  • 引入视觉和知识图谱嵌入显著提升了相似度得分,表明这些模态提供了文本无法捕捉的互补信息。
  • 共享概念空间与人工标注的相似度判断具有更高的相关性,证明其与人类感知更为一致。
  • 该方法表明,即使模态间概念重叠有限,对齐嵌入的融合仍能产生更稳健、更全面的表征。
  • 尽管视觉嵌入因覆盖范围有限而成为瓶颈,但经过恰当对齐后,仍对最终表征质量有显著贡献。
  • 两步对齐过程——即通过WordNet将知识图谱和图像特征映射到词级别概念——在实现跨模态融合方面被证明是有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。