Skip to main content
QUICK REVIEW

[论文解读] A Systematic Investigation of Commonsense Knowledge in Large Language Models

Xiang Lorraine Li, Adhiguna Kuncoro|arXiv (Cornell University)|Oct 31, 2021
Topic Modeling被引用 4
一句话总结

本文对最大达2800亿参数的大规模语言模型在常识基准上进行了严格的零样本和少样本评估,控制了表面线索和评估伪影。研究发现,尽管表现强劲,模型在常识理解方面仍远未达到人类水平,增加模型规模或使用少样本提示也无法在无任务特定监督的情况下弥合这一差距。

ABSTRACT

Language models (LMs) trained on large amounts of data have shown impressive performance on many NLP tasks under the zero-shot and few-shot setup. Here we aim to better understand the extent to which such models learn commonsense knowledge -- a critical component of many NLP applications. We conduct a systematic and rigorous zero-shot and few-shot commonsense evaluation of large pre-trained LMs, where we: (i) carefully control for the LMs' ability to exploit potential surface cues and annotation artefacts, and (ii) account for variations in performance that arise from factors that are not related to commonsense knowledge. Our findings highlight the limitations of pre-trained LMs in acquiring commonsense knowledge without task-specific supervision; furthermore, using larger models or few-shot evaluation are insufficient to achieve human-level commonsense performance.

研究动机与目标

  • 严格评估大规模语言模型在无任务特定微调的情况下获取常识知识的能力。
  • 分离模型表现中源于实际常识推理还是表面线索或标注伪影的程度。
  • 评估评估设计选择(如提示格式和评分函数)对性能波动的影响。
  • 确定增加模型规模或使用少样本上下文学习是否能提升常识推理能力。
  • 挑战大规模语言模型具备开箱即用的常识推理能力的假设。

提出的方法

  • 本研究在零样本和少样本设置下,对Gopher语言模型系列(最大达2800亿参数)在四个常识基准上进行评估。
  • 采用严格的仅答案基线,以控制因统计猜测导致的性能,与推理能力无关。
  • 通过多种提示格式和评分函数评估性能,以检验评估设计的鲁棒性。
  • 通过分析从12500万到2800亿参数共六种模型规模的性能趋势,研究扩展行为。
  • 评估过程中未进行任何微调,确保观察到的性能反映预训练知识的获取情况。
  • 应用统计控制,以隔离常识知识的影响,排除数据中偶然相关性的干扰。

实验结果

研究问题

  • RQ1大规模语言模型在多大程度上真正理解常识知识,还是仅依赖数据中的表面线索?
  • RQ2评估设计选择(如提示格式和评分函数)在多大程度上影响模型性能,而与常识推理无关?
  • RQ3增加模型规模或使用少样本上下文学习是否能在零样本设置下显著提升常识推理能力?
  • RQ4在无任务特定监督的情况下,当前大规模语言模型能否在常识基准上达到人类水平表现?
  • RQ5假设无显式常识监督,达到人类水平表现所需的模型规模是多少?

主要发现

  • 仅答案基线在某些基准上表现优于许多模型,表明表面统计模式对性能有显著贡献。
  • 即使在2800亿参数下,模型在零样本设置下仍无法在四个基准中的三个达到人类水平表现。
  • 仅通过扩大模型规模不足以弥合与人类的性能差距,需模型参数量达100万亿至10^18量级——远超当前可行性。
  • 少样本提示仅在Social IQa上提升性能,其他基准上增益微乎其微,无法缩小与最先进模型的差距。
  • 评估设计选择(如提示格式和评分函数)可导致性能波动高达19%,凸显对非常识因素的敏感性。
  • 结果表明,当前大规模语言模型在无显式监督、多模态支撑或其他归纳偏置的情况下,无法可靠获取人类水平的常识知识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。