[论文解读] Birds have four legs?! NumerSense: Probing Numerical Commonsense Knowledge of Pre-trained Language Models
本文提出了NumerSense,一种诊断性探针任务和数据集,用于评估预训练语言模型(PTLMs)对数值常识知识(如“一只鸟有两条腿”)的捕捉能力。通过掩码语言建模,研究发现,即使经过远程监督微调,BERT和RoBERTa的表现依然较差(准确率为54.06%),远低于人类水平(96.3%),凸显了PTLMs在事实性数值推理能力上的关键差距。
Recent works show that pre-trained language models (PTLMs), such as BERT, possess certain commonsense and factual knowledge. They suggest that it is promising to use PTLMs as "neural knowledge bases" via predicting masked words. Surprisingly, we find that this may not work for numerical commonsense knowledge (e.g., a bird usually has two legs). In this paper, we investigate whether and to what extent we can induce numerical commonsense knowledge from PTLMs as well as the robustness of this process. To study this, we introduce a novel probing task with a diagnostic dataset, NumerSense, containing 13.6k masked-word-prediction probes (10.5k for fine-tuning and 3.1k for testing). Our analysis reveals that: (1) BERT and its stronger variant RoBERTa perform poorly on the diagnostic dataset prior to any fine-tuning; (2) fine-tuning with distant supervision brings some improvement; (3) the best supervised model still performs poorly as compared to human performance (54.06% vs 96.3% in accuracy).
研究动机与目标
- 探究预训练语言模型(PTLMs)是否能够捕捉并推理关于数值常识知识(如“一只鸟有两条腿”)的信息。
- 弥补现有探针任务仅关注语言或定性常识知识,而忽视定量事实的缺陷。
- 评估PTLMs对影响数值推理的小型输入扰动(如在掩码数字词附近插入形容词)的鲁棒性。
- 评估远程监督和微调在提升PTLMs在数值常识任务上表现方面的有效性。
- 提供一个诊断性数据集,作为未来研究提升PTLMs数值推理能力和知识对齐的基准。
提出的方法
- 设计一种掩码词探针任务,要求模型预测最可能填入句子中掩码位置的数字词(如“两”),以满足数值常识要求。
- 通过筛选和人工审核来自Open Mind Common Sense(OMCS)语料库的语句,构建包含13,600个探针的数据集(其中10,500个用于微调,3,100个用于测试)。
- 通过在探针中的名词附近插入形容词(如“圆的”)生成对抗性样本,源自ConceptNet,以测试模型的鲁棒性。
- 在两种设置下评估模型:零样本(无微调)和远程监督(在与常识推理相关的数据集如CommonsenseQA上微调)。
- 使用softmax得分对候选数字词进行排序,以衡量模型对正确答案的置信度,通过准确率衡量性能。
- 将探针转换为自然语言问题,与人类标注者及当前最先进的开放域问答模型进行对比评估。
实验结果
研究问题
- RQ1预训练语言模型(如BERT和RoBERTa)在通过掩码语言建模恢复如“一只鸟有两条腿”这类数值常识事实方面,能力如何?
- RQ2这些模型对微小输入扰动(如插入形容词“圆的”)的鲁棒性如何?此类扰动虽改变上下文但不改变事实含义。
- RQ3来自相关常识推理数据集的远程监督能否显著提升PTLMs在数值常识探针任务上的表现?
- RQ4PTLMs在NumerSense上的表现与人类表现以及当前最先进的开放域问答模型在“多少”类问题上的表现相比如何?
- RQ5PTLMs在数值常识推理中的关键失败模式是什么?其表现差强人意的原因是什么,即使在自监督预训练之后?
主要发现
- 在零样本设置下,BERT和RoBERTa在NumerSense诊断数据集上的准确率仅为54.06%,表明其在数值常识知识方面表现极差。
- 使用来自相关常识数据集的远程监督进行微调虽提升了性能,但与人类表现(96.3%准确率)相比仍有显著差距。
- 表现最佳的有监督模型仍远低于人类水平,表明当前PTLMs缺乏对精确数值事实的可靠编码能力。
- 模型表现出较差的鲁棒性:在句子“一只圆的鸟通常有[MASK]条腿”中插入形容词“圆的”,会导致BERT将预测从“四”切换为“二”,显示出显著的不稳定性。
- 当前最先进的开放域问答模型(在Natural Questions上微调)在相同“多少”类问题上的准确率仅为15.4%,甚至低于未微调的BERT-base,表明当前问答系统在数值常识方面也存在困难。
- 本研究揭示了一个关键的研究空白:尽管PTLMs能捕捉语言和定性常识,却无法可靠地编码或检索精确的数值事实,即使这些事实是常识性的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。