Skip to main content
QUICK REVIEW

[论文解读] Prompting as Probing: Using Language Models for Knowledge Base Construction

Dimitrios Alivanistos, Selene Báez Santamaría|arXiv (Cornell University)|Aug 23, 2022
Topic Modeling被引用 14
一句话总结

本文提出了 ProP,一种将提示工程作为探针的框架,利用 GPT-3 通过生成主语-关系三元组的对象预测来构建知识库。通过结合精心筛选的提示、实体别名扩展以及真假验证,ProP 在 ISWC 2022 的 LM-KBC 挑战赛中相较基线模型提升了 36.4 个百分点,证明了人工提示工程与模型规模对于利用大语言模型构建高质量知识库至关重要。

ABSTRACT

Language Models (LMs) have proven to be useful in various downstream applications, such as summarisation, translation, question answering and text classification. LMs are becoming increasingly important tools in Artificial Intelligence, because of the vast quantity of information they can store. In this work, we present ProP (Prompting as Probing), which utilizes GPT-3, a large Language Model originally proposed by OpenAI in 2020, to perform the task of Knowledge Base Construction (KBC). ProP implements a multi-step approach that combines a variety of prompting techniques to achieve this. Our results show that manual prompt curation is essential, that the LM must be encouraged to give answer sets of variable lengths, in particular including empty answer sets, that true/false questions are a useful device to increase precision on suggestions generated by the LM, that the size of the LM is a crucial factor, and that a dictionary of entity aliases improves the LM score. Our evaluation study indicates that these proposed techniques can substantially enhance the quality of the final predictions: ProP won track 2 of the LM-KBC competition, outperforming the baseline by 36.4 percentage points. Our implementation is available on https://github.com/HEmile/iswc-challenge.

研究动机与目标

  • 通过将提示工程视为事实性知识的探针机制,提升利用大语言模型进行知识库构建的质量。
  • 解决在零样本设置下预测可变长度答案集(包括空集)的挑战。
  • 评估提示设计、模型规模以及辅助组件(如实体别名词典)对预测质量的影响。
  • 在模糊或罕见实体场景下,提升知识库补全任务的精确率与召回率,超越基于字符串匹配的基线方法。
  • 证明当结合结构化后处理与验证技术时,大语言模型能够有效增强知识图谱。

提出的方法

  • ProP 采用多步骤流水线,将主语-关系对转化为自然语言提示,用于向 GPT-3 探测潜在的对象答案。
  • 通过人工筛选提示,生成多样化、与关系相关的提示,以激发结构化、可变长度的响应,包括空集。
  • 别名获取组件用于检索实体的已知同义词和替代名称,以提升匹配准确率与召回率。
  • 通过提出关于候选对象的二元问题,应用真假验证来过滤低置信度的预测。
  • 系统使用少样本示例和结构化数据增强技术,以提升在多样化关系上的泛化能力与鲁棒性。
  • 后处理包括归一化、去重以及使用模糊匹配对齐真实标签,以应对别名差异。

实验结果

研究问题

  • RQ1人工提示筛选在利用大语言模型进行知识库构建时,对对象预测质量有何影响?
  • RQ2鼓励生成可变长度输出(包括空集)在开放式知识库构建任务中的性能提升程度如何?
  • RQ3真假验证问题在提升大语言模型生成预测的精确率方面有多有效?
  • RQ4语言模型的规模对知识库构建中最终预测质量的影响有多大?
  • RQ5实体别名扩展是否能显著提升大语言模型在知识库构建中的召回率与鲁棒性?

主要发现

  • ProP 在 LM-KBC 挑战赛测试集的宏平均 F1 指标上相较基线模型提升了 36.4 个百分点,在 Track 2 中取得最高分。
  • 人工提示筛选至关重要,自动生成的提示导致性能显著下降。
  • 鼓励 GPT-3 生成可变长度输出(包括空集)有助于更好地匹配开放式预测任务的需求。
  • 真假验证通过过滤错误或幻觉性预测,显著提升了精确率,尤其在模糊关系上效果明显。
  • 语言模型的规模是影响性能的最关键因素,更大的模型(如 GPT-3)能带来显著更优的结果。
  • 实体别名词典提升了匹配准确率;在某些情况下,ProP 的预测正确,但因真实标签中的别名不匹配而被标记为错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。