Skip to main content
QUICK REVIEW

[论文解读] Sequence-to-Sequence Knowledge Graph Completion and Question Answering

Apoorv Saxena, Adrian Kochsiek|arXiv (Cornell University)|Mar 19, 2022
Advanced Graph Neural Networks被引用 11
一句话总结

本文提出 KGT5,一种序列到序列的 Transformer 模型,将知识图谱补全(KGC)和问答(KGQA)任务统一为文本生成任务。通过使用自回归解码在链接预测上训练一个类似 T5-small 的模型,KGT5 在 KGC 和 KGQA 任务上均达到最先进性能,模型参数量相比传统 KGE 模型减少高达 98%,同时保持可处理的推理效率,并支持跨任务的统一、端到端训练。

ABSTRACT

Knowledge graph embedding (KGE) models represent each entity and relation of a knowledge graph (KG) with low-dimensional embedding vectors. These methods have recently been applied to KG link prediction and question answering over incomplete KGs (KGQA). KGEs typically create an embedding for each entity in the graph, which results in large model sizes on real-world graphs with millions of entities. For downstream tasks these atomic entity representations often need to be integrated into a multi stage pipeline, limiting their utility. We show that an off-the-shelf encoder-decoder Transformer model can serve as a scalable and versatile KGE model obtaining state-of-the-art results for KG link prediction and incomplete KG question answering. We achieve this by posing KG link prediction as a sequence-to-sequence task and exchange the triple scoring approach taken by prior KGE methods with autoregressive decoding. Such a simple but powerful method reduces the model size up to 98% compared to conventional KGE models while keeping inference time tractable. After finetuning this model on the task of KGQA over incomplete KGs, our approach outperforms baselines on multiple large-scale datasets without extensive hyperparameter tuning.

研究动机与目标

  • 解决现有知识图谱嵌入(KGE)模型在可扩展性、质量、多功能性和简洁性方面的局限性。
  • 将知识图谱补全与问答任务统一为一个可扩展且端到端可训练的框架。
  • 在保持或提升大规模知识图谱上性能的同时,减少模型大小和推理成本。
  • 评估在链接预测上预训练是否比通用语言建模更有效于知识密集型任务(如 KGQA)。
  • 探究在不完整知识图谱中,低容量模型的记忆能力与泛化能力之间的权衡。

提出的方法

  • 该模型使用现成的编码器-解码器 Transformer(T5-small 架构)对知识图谱三元组进行序列到序列预测。
  • 将链接预测重新定义为文本生成任务:给定关系及一个实体(头实体或尾实体),模型自回归地生成缺失的实体。
  • 模型首先在大规模知识图谱上使用三元组序列上的掩码跨度预测目标进行预训练。
  • 对于问答任务,使用问答对对同一模型进行微调,并通过链接预测目标的正则化保留关系知识。
  • 实体表示通过其文本提及生成,从而实现组合性编码,无需专门的实体嵌入。
  • 通过避免为每个实体使用嵌入向量,转而依赖对标记序列的自回归解码,显著减小模型规模。

实验结果

研究问题

  • RQ1能否使用标准 Transformer 编码器-解码器架构,将知识图谱补全有效重构为序列到序列生成任务?
  • RQ2在性能和模型效率方面,是否一个在链接预测上训练的统一序列到序列模型优于专用的 KGE 模型?
  • RQ3该模型在无需大量超参数调优的情况下,能否在不完整知识图谱的问答任务中表现出良好的泛化能力?
  • RQ4在下游 KGQA 任务中,与通用语言建模相比,在链接预测上预训练的效果如何?
  • RQ5模型容量在多大程度上限制了其对已知事实的记忆能力,特别是在低参数量模型中?

主要发现

  • KGT5 在知识图谱补全任务上达到最先进性能,在 Wikidata5M 上测试 MRR 达 0.300,尽管参数量仅 6000 万(对比 ComplEx 的 6.14 亿),其推理效率仍优于 ComplEx。
  • 与传统 KGE 模型相比,该模型在大规模知识图谱(最多 9000 万个实体)上实现高达 98% 的参数量减少,同时保持竞争力性能。
  • 在 KGQA 基准测试中,当在知识图谱上完全预训练后,KGT5 在 WQSP 上达到 Hits@1 56.1,在 CWQ 上达到 36.5,优于仅在 QA 上微调的 T5-small 模型。
  • 在 KGQA 任务中,在链接预测上预训练显著优于通用语言建模,KGT5 的性能明显优于仅在 QA 上微调的 T5-small 模型。
  • 在完整知识图谱设置下,KGT5 表现欠佳,WQSP 上 Hits@1 为 56.1,表明由于模型容量较低(6000 万个参数),其记忆能力有限。
  • KGT5 的训练 MRR(0.304)远低于 ComplEx(0.721),证实该模型在记忆训练事实方面存在困难,这限制了其在闭卷问答任务中的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。