Skip to main content
QUICK REVIEW

[论文解读] Negated LAMA: Birds cannot fly

Nora Kassner, Hinrich Schütze|arXiv (Cornell University)|Nov 8, 2019
Topic Modeling被引用 17
一句话总结

本文提出了两项探针任务——否定与误提示(mispriming),用以评估预训练语言模型(PLMs)对事实性知识的保留能力。结果表明,PLMs 无法区分被否定与未被否定的完形填空问题,且容易被无关的误提示所误导,表明其在学习类人事实性知识方面存在显著局限。

ABSTRACT

Building on Petroni et al. (2019), we propose two new probing tasks analyzing factual knowledge stored in Pretrained Language Models (PLMs). (1) Negation. We find that PLMs do not distinguish between negated (Birds cannot [MASK]) and non-negated (Birds can [MASK]) cloze questions. (2) Mispriming. Inspired by priming methods in human psychology, we add misprimes to cloze questions (Talk? Birds can [MASK]). We find that PLMs are easily distracted by misprimes. These results suggest that PLMs still have a long way to go to adequately learn human-like factual knowledge.

研究动机与目标

  • 探究预训练语言模型(PLMs)是否能够准确表示并区分被否定与未被否定的事实性陈述。
  • 检验 PLMs 在完形填空类问题中是否容易受到无关或误导性上下文线索的干扰。
  • 评估 PLMs 内部化事实性知识的程度,以判断其是否能体现类人推理与鲁棒性。
  • 开发探针任务,以揭示 PLMs 在事实性知识表征中的根本性弱点。

提出的方法

  • 设计一项否定探针任务,将完形填空问题以被否定形式(如 'Birds cannot [MASK]')和非被否定形式(如 'Birds can [MASK]')呈现。
  • 在两种形式中使用相同事实性知识(例如,正确答案为 'fly'),以隔离模型处理否定的能力。
  • 在完形填空问题前引入误提示——即无关或具有误导性的词语(如 'Talk?'),以测试模型的鲁棒性。
  • 通过测量模型对掩码标记的预测,评估否定或误提示是否以反映理解的方式改变模型输出。
  • 比较标准、被否定和误提示完形填空问题中模型的预测准确率与置信度。
  • 基于 LAMA 基准(Petroni et al., 2019)构建探针框架,并扩展出包含否定与误提示变体的版本。

实验结果

研究问题

  • RQ1当句子被否定时,PLMs 是否能正确识别完形填空问题中的正确答案?
  • RQ2误提示的存在是否显著改变模型在完形填空问题中的预测结果?
  • RQ3PLMs 在被否定和误提示完形填空问题上的表现,与在标准事实性完形填空问题上的表现相比如何?
  • RQ4PLMs 在句法与上下文扰动下,能在多大程度上体现类人对事实性知识的理解?

主要发现

  • PLMs 无法区分被否定与未被否定的完形填空问题,通常在两种情况下对正确答案赋予相似的概率。
  • 当句子被否定时,模型的置信度或准确率未出现显著下降,表明其对否定的处理能力较差。
  • 如 'Talk?' 等误提示显著影响模型预测,导致错误或不一致的输出。
  • 模型的预测极易受到语义无关上下文的干扰,表明其推理与注意力控制能力较弱。
  • 这些结果表明,PLMs 以脆弱、上下文敏感的方式存储事实性知识,而非以稳健、结构化的事实形式。
  • 研究结果凸显了 PLMs 在以类人认知方式学习与应用事实性知识方面存在关键性缺陷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。