Skip to main content
QUICK REVIEW

[论文解读] Language Models As or For Knowledge Bases

Simon Razniewski, Andrew Yates|arXiv (Cornell University)|Oct 10, 2021
Topic Modeling参考文献 27被引用 16
一句话总结

本文认为,尽管大型语言模型(LMs)由于固有的不确定性与幻觉问题,无法替代结构化知识库(KBs),但它们在知识库维护中极具价值,可作为验证或反驳候选事实的‘第二意见’。作者提出利用LMs探测新断言,借助其外部文本知识提升KB质量,减少知识库维护过程中的错误。

ABSTRACT

Pre-trained language models (LMs) have recently gained attention for their potential as an alternative to (or proxy for) explicit knowledge bases (KBs). In this position paper, we examine this hypothesis, identify strengths and limitations of both LMs and KBs, and discuss the complementary nature of the two paradigms. In particular, we offer qualitative arguments that latent LMs are not suitable as a substitute for explicit KBs, but could play a major role for augmenting and curating KBs.

研究动机与目标

  • 评估微调语言模型(LMs)在准确性、可靠性和可维护性方面是否可作为显式知识库(KBs)的可行替代方案。
  • 识别LMs作为KBs的核心局限,包括幻觉、缺乏来源证明,以及无法区分事实与相关性。
  • 研究如何在知识库维护过程中利用LMs提升KB质量,特别是检测重复实体、验证新事实以及确保一致性。
  • 对比LMs与KBs在知识表示、模式灵活性和维护开销方面的优缺点。
  • 倡导LMs与KBs互补的角色:LMs作为KB断言的外部验证者,而非独立的知识存储库。

提出的方法

  • 使用GPT-3作为主要LM,作者通过零样本提示(例如:'艾伦·图灵出生于___')获取模型完成的主-谓-宾三元组。
  • 将LM对每个完成结果分配的置信度分数用作候选事实合理性的证据,高置信度表示潜在有效性。
  • 通过自然语言提示探测LM,分析其最高排名预测及其相关概率,评估候选KB断言。
  • 该方法将LM视为外部验证者:若LM对候选事实赋予低置信度,则将其标记为需审查或拒绝。
  • 该框架支持验证(检查现有事实)和候选生成(利用LM提出新事实),尽管后者仍需进一步完善。
  • 该方法强调利用LM检测不一致性和幻觉(如错误配偶或错误奖项)的能力,通过将预测与已知KB事实对比实现。

实验结果

研究问题

  • RQ1语言模型在事实准确性和一致性方面能否可靠地替代结构化知识库?
  • RQ2当查询关于事实知识时,语言模型在多大程度上会产生幻觉或错误阳性结果?
  • RQ3语言模型的置信度分数与生成事实的真实性之间存在何种相关性,特别是在罕见或唯一值情况下?
  • RQ4语言模型能否在知识库维护过程中作为独立证据源,用于验证或反驳候选事实?
  • RQ5将LMs用作KBs的主要局限是什么,特别是关于知识来源证明、模式灵活性和维护方面?

主要发现

  • GPT-3对‘艾伦·图灵出生于伦敦’这一事实赋予83%的高置信度,但同时也以21%的置信度生成了‘萨拉·拉文顿’作为其配偶的错误断言。
  • LM错误预测艾伦·图灵获得诺贝尔奖(置信度26%),并将‘战争’作为奖项(置信度26%),显示出对共现术语的系统性偏见。
  • 对于提示‘第一个登陆月球的女性是’,GPT-3生成了萨利·莱德和伊莱恩·柯林斯等虚假姓名,尽管至今尚无女性登陆月球,凸显了模型对事实缺失的识别能力不足。
  • 当被要求提供图灵研究所的地址时,LM错误地输出‘迪利小屋’而非正确地址,表明其在罕见或唯一事实值上的表现较差。
  • 在被要求列出图灵奖得主时,GPT-3返回了正确与错误姓名的混合结果,需通过深度排序才能检索全部73位得主,且缺乏明确的有效性终止点。
  • 相比之下,Wikidata明确指出艾伦·图灵无配偶,使用‘无值’声明,而LMs由于其潜在的概率本质,无法表达此类否定性陈述。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。