Skip to main content
QUICK REVIEW

[论文解读] Endowing Language Models with Multimodal Knowledge Graph Representations

Ningyuan Huang, Yash R. Deshpande|arXiv (Cornell University)|Jun 27, 2022
Topic Modeling被引用 10
一句话总结

本文通过使用密集向量索引从VisualSem知识图谱(KG)中检索实体嵌入,提出了一种通过多模态知识图谱表示来增强语言模型的方法。通过结合基于混合元组和图的模型的视觉、文本和结构特征,该方法在多语言命名实体识别任务中提升了0.3–0.7%的F1分数,在跨语言视觉语义消歧任务中最高提升了2.5%的准确率。

ABSTRACT

We propose a method to make natural language understanding models more parameter efficient by storing knowledge in an external knowledge graph (KG) and retrieving from this KG using a dense index. Given (possibly multilingual) downstream task data, e.g., sentences in German, we retrieve entities from the KG and use their multimodal representations to improve downstream task performance. We use the recently released VisualSem KG as our external knowledge repository, which covers a subset of Wikipedia and WordNet entities, and compare a mix of tuple-based and graph-based algorithms to learn entity and relation representations that are grounded on the KG multimodal information. We demonstrate the usefulness of the learned entity representations on two downstream tasks, and show improved performance on the multilingual named entity recognition task by $0.3\%$--$0.7\%$ F1, while we achieve up to $2.5\%$ improvement in accuracy on the visual sense disambiguation task. All our code and data are available in: \url{https://github.com/iacercalixto/visualsem-kg}.

研究动机与目标

  • 通过将知识卸载到外部多模态知识图谱而非存储在模型参数中,实现自然语言理解(NLU)模型的参数效率提升。
  • 研究如何结合多模态信号——视觉、文本和结构信息——以在知识图谱中学习鲁棒的实体和关系表示。
  • 评估这些学习到的表示在下游NLU任务中的实用性,特别是在多语言和视觉-语言设置下的表现。
  • 公开发布学习到的实体和关系表示,以支持未来在多模态知识对齐方面的研究。
  • 比较在多语言、多模态知识图谱中用于表示学习的基于元组和基于图的神经架构。

提出的方法

  • 通过句子检索模型,利用密集向量索引从VisualSem KG中检索与输入句子(例如德语句子)相关的实体,将输入映射到KG节点。
  • 通过联合编码视觉特征(ResNet-152 pool5特征)、文本描述(BERT嵌入)和结构图信息,学习多模态实体表示。
  • 采用混合表示学习框架,结合基于元组(如TransE风格)和基于图(如GNN风格)的方法,以预测KG结构并提升泛化能力。
  • 使用对比学习目标训练实体和关系表示,使正样本三元组(头实体,关系,尾实体)的嵌入距离比负样本更近。
  • 通过将检索到的实体表示与输入表示拼接,将其作为外部特征集成到下游模型中,而无需微调基础语言模型。
  • 使用两层前馈网络(含ReLU和Softmax)进行分类,输入通过引入检索到的实体表示进行增强,以提升预测性能。

实验结果

研究问题

  • RQ1在VisualSem KG中,不同基于元组和基于图的神经架构在学习多模态实体和关系表示方面表现如何?
  • RQ2在链接预测任务背景下,视觉和文本模态在多大程度上提升了学习到的实体表示的质量?
  • RQ3在推理时检索的多模态KG表示是否能提升多语言命名实体识别和跨语言视觉动词语义消歧任务的性能?
  • RQ4在保持参数效率的前提下,外部多模态知识的集成如何影响模型性能?
  • RQ5视觉、文本和结构信息对最终实体表示质量的相对影响是什么?

主要发现

  • 混合基于元组和图的模型在实体表示学习方面优于纯基于元组或纯基于图的基线模型,其性能通过链接预测任务衡量。
  • 与基线相比,将视觉特征整合到实体表示中,使跨语言视觉动词语义消歧任务的准确率绝对提升了2.5%。
  • 在使用检索到的VisualSem实体表示时,多语言命名实体识别任务的F1分数绝对提升了0.3%至0.7%。
  • 在14种语言中使用文本描述及其关联图像,显著提升了学习到的实体表示质量,尤其在跨语言任务中表现突出。
  • 性能增益在不同下游架构中保持一致,表明检索到的表示具有鲁棒性和泛化能力。
  • 公开发布的实体和关系表示被证明在下游NLU任务中有效,预计将进一步加速多模态知识对齐领域的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。