Skip to main content
QUICK REVIEW

[论文解读] Knowledgeable or Educated Guess? Revisiting Language Models as Knowledge Bases

Boxi Cao, Hongyu Lin|arXiv (Cornell University)|Jun 17, 2021
Topic Modeling参考文献 40被引用 9
一句话总结

本文研究了像 BERT 这类预训练掩码语言模型(MLMs)是否能可靠地作为事实知识库。通过严格分析三种知识提取范式——基于提示的、基于案例的和基于上下文的——发现高性能并非源于真正的知识检索,而是源于提示偏差、实体类型引导以及外部上下文中的答案泄露(显式或隐式)。该研究质疑了先前认为 MLMs 是可信知识源的结论。

ABSTRACT

Previous literatures show that pre-trained masked language models (MLMs) such as BERT can achieve competitive factual knowledge extraction performance on some datasets, indicating that MLMs can potentially be a reliable knowledge source. In this paper, we conduct a rigorous study to explore the underlying predicting mechanisms of MLMs over different extraction paradigms. By investigating the behaviors of MLMs, we find that previous decent performance mainly owes to the biased prompts which overfit dataset artifacts. Furthermore, incorporating illustrative cases and external contexts improve knowledge prediction mainly due to entity type guidance and golden answer leakage. Our findings shed light on the underlying predicting mechanisms of MLMs, and strongly question the previous conclusion that current MLMs can potentially serve as reliable factual knowledge bases.

研究动机与目标

  • 严格评估掩码语言模型(MLMs)如 BERT 是否可作为可靠的事实知识库。
  • 探究三种主流知识提取范式(基于提示的、基于案例的和基于上下文的检索)中驱动性能的底层机制。
  • 识别高性能表现是否源于真正的知识访问,还是源于提示偏差、实体类型引导或答案泄露等人工产物。
  • 质疑先前假设 MLMs 拥有可靠事实知识的基准测试与评估的有效性。

提出的方法

  • 对三种知识提取范式进行了系统性分析:基于提示的检索、基于案例的类比以及使用 BERT-large 和 RoBERTa-large 的基于上下文的推理。
  • 提出一种新颖算法,利用 Wikidata 分类体系为关系诱导对象类型,以评估在基于案例范式中类型引导的作用。
  • 通过在上下文中屏蔽黄金答案,在受控环境下评估性能,以区分显式与隐式答案泄露。
  • 根据被遮蔽的答案是否能从剩余上下文中重建,对上下文进行分组,以隔离隐式答案泄露的影响。
  • 使用标准基准(如 LAMA)上的准确率和 F1 等定量指标,比较不同范式和条件下的性能表现。
  • 进行消融研究,以分离提示、示例案例和外部上下文对预测性能的独立贡献。

实验结果

研究问题

  • RQ1基于提示的知识提取在多大程度上依赖于提示设计,而非模型内部的事实知识?
  • RQ2示例案例在多大程度上影响了 MLM 的预测——是提升了事实准确性,还是仅引导了实体类型识别?
  • RQ3在基于上下文的推理中,外部上下文的真正作用是什么:答案泄露还是上下文推理?
  • RQ4外部上下文带来的性能提升是否可归因于答案的显式存在,还是隐式重建?
  • RQ5当前评估基准在多大程度上反映了真正的知识检索,而非数据集特定的偏差等人工产物?

主要发现

  • 基于提示的检索性能严重受提示结构影响,预测结果与提示措辞的相关性高于与事实准确性的相关性,表明泛化能力差。
  • 示例案例主要通过提供实体类型引导来提升性能,而非增强同一类型类别内精确答案的选择能力。
  • 外部上下文显著提升了性能,主要归因于答案泄露——无论是显式提及还是从上下文中隐式重建答案。
  • 即使在上下文中遮蔽了黄金答案,若剩余上下文允许答案重建,性能仍保持较高水平,证实了隐式答案泄露的作用。
  • 基于上下文推理的性能提升并非源于对上下文的推理,而是源于存在足够与答案相关的证据,无论显式或隐式。
  • 总体发现挑战了先前认为 MLMs 可作为可靠知识库的结论,揭示当前成功源于数据集人工产物,而非稳健的知识访问能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。