[论文解读] SKILL: Structured Knowledge Infusion for Large Language Models
本文提出SKILL方法,直接在知识图谱(KG)中的事实三元组上对T5语言模型进行端到端预训练,无需文本对齐或句子生成。该方法在闭卷问答任务中达到最先进性能,包括在使用WikiMovies数据集的MetaQA任务中将精确匹配分数提升3倍,并在FreebaseQA、WikiHop和TriviaQA上取得优异结果,证明大语言模型可无需自然语言监督,有效从结构化知识中学习。
Large language models (LLMs) have demonstrated human-level performance on a vast spectrum of natural language tasks. However, it is largely unexplored whether they can better internalize knowledge from a structured data, such as a knowledge graph, or from text. In this work, we propose a method to infuse structured knowledge into LLMs, by directly training T5 models on factual triples of knowledge graphs (KGs). We show that models pre-trained on Wikidata KG with our method outperform the T5 baselines on FreebaseQA and WikiHop, as well as the Wikidata-answerable subset of TriviaQA and NaturalQuestions. The models pre-trained on factual triples compare competitively with the ones on natural language sentences that contain the same knowledge. Trained on a smaller size KG, WikiMovies, we saw 3x improvement of exact match score on MetaQA task compared to T5 baseline. The proposed method has an advantage that no alignment between the knowledge graph and text corpus is required in curating training data. This makes our method particularly useful when working with industry-scale knowledge graphs.
研究动机与目标
- 探究大型语言模型是否能直接从结构化知识图谱三元组中有效学习并内化事实知识。
- 开发一种可扩展的知识注入方法,将知识融入大语言模型,避免将KG三元组与自然语言文本对齐的需求。
- 评估直接在三元组上训练是否优于或等同于在包含相同知识的自然语言句子上进行训练。
- 评估模型规模与KG规模对知识记忆与推理性能的影响。
- 实现工业级规模知识图谱在大语言模型预训练中的高效集成,无需昂贵的数据清洗流程。
提出的方法
- 该方法使用标准掩码语言建模(MLM)目标,直接在知识图谱的三元组(主语-关系-客体)上预训练T5模型。
- 训练数据由原始KG三元组构成,格式化为类似'Barack Obama - was born in - Kenya'的文本字符串,无需实体链接或句子生成。
- 该方法消除了将三元组与外部文本语料库对齐或生成自然语言描述的需求,降低了数据清洗复杂度。
- 模型在下游问答任务上进行微调,不依赖检索增强,完全依赖预训练期间嵌入的知识。
- 通过直接使用Wikidata和WikiMovies等知识图谱的三元组格式,该方法可轻松扩展至大规模KG。
- 所有实验保持超参数一致,包括在WikiMovies上训练100K步,在Wikidata上训练200K步。
实验结果
研究问题
- RQ1大型语言模型(如T5)是否能在无需自然语言监督的情况下,直接从结构化知识图谱三元组中学习事实知识?
- RQ2在闭卷问答任务中,基于KG三元组预训练的模型与基于包含相同知识的自然语言句子预训练的模型相比,性能表现如何?
- RQ3SKILL预训练带来的性能提升是否随模型规模和KG规模的增大而提升?
- RQ4当仅在原始三元组上进行训练时,模型在多大程度上能实现知识记忆与推理?
- RQ5SKILL能否在无需模式对齐或文本生成的前提下,有效应用于工业级规模的知识图谱?
主要发现
- 在使用WikiMovies KG的MetaQA基准上,SKILL预训练的T5.1.1-large模型在测试集上的精确匹配分数达到71.52,相比基线模型提升3倍。
- 在Wikidata三元组上预训练的SKILL模型在FreebaseQA、WikiHop以及TriviaQA的Wikidata可回答子集上均优于T5基线模型。
- 在三元组上直接训练的模型性能与在对齐自然语言句子上训练的模型相当,表明直接三元组训练方法有效。
- 性能提升在更大模型上更为显著,随着模型规模增大,性能增益也相应提升,表明该方法具有良好的可扩展性。
- 在一跳问答任务中(单个三元组即可满足),性能提升显著;在需推理的两跳或三跳任务中,增益较小,表明模型在捕捉图结构方面存在局限。
- 在C4上进行额外预训练,提升了T5.1.1-base和-large版本的性能,但导致XXL版本出现性能下降,与先前关于过拟合训练的发现一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。