[论文解读] Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds
本文研究了ChatGPT在处理简单语言推理任务中的局限性,例如语法指定的蕴含关系、表示不确定性的证据性副词以及单调性蕴含。研究发现,尽管模型在直接提问时能理解相关概念,但在零样本推理任务中却无法有效应用这些知识。研究识别出由预设触发词和非事实性动词引起的‘盲点’,这些因素扭曲了推理预测,揭示了大型语言模型在表面流畅性之外存在的系统性推理盲区。
We evaluate LLMs' language understanding capacities on simple inference tasks that most humans find trivial. Specifically, we target (i) grammatically-specified entailments, (ii) premises with evidential adverbs of uncertainty, and (iii) monotonicity entailments. We design evaluation sets for these tasks and conduct experiments in both zero-shot and chain-of-thought setups, and with multiple prompts and LLMs. The models exhibit moderate to low performance on these evaluation sets. Subsequent experiments show that embedding the premise in syntactic constructions that should preserve the entailment relations (presupposition triggers) or change them (non-factives), further confuses the models, causing them to either under-predict or over-predict certain entailment labels regardless of the true relation, and often disregarding the nature of the embedding context. Overall these results suggest that, despite LLMs' celebrated language understanding capacity, even the strongest models have blindspots with respect to certain types of entailments, and certain information-packaging structures act as ``blinds'' overshadowing the semantics of the embedded premise.
研究动机与目标
- 调查ChatGPT在人类轻而易举但对模型具有挑战性的简单语言推理任务中的表现。
- 检验ChatGPT在直接提示下展示出的语言知识是否能一致地应用于实际推理任务。
- 分析将前提句置于预设性结构或非事实性动词语境中时,对推理准确率的影响。
- 识别导致蕴含预测扭曲的输入句结构特征,这些特征可被视为‘盲区’。
- 为理解大型语言模型在高风险应用场景中的可靠性与可信度提供贡献。
提出的方法
- 人工整理专家设计的三类推理类型测试集:语法指定的蕴含关系、证据性副词(如“据称”)以及单调性蕴含(上行/下行)。
- 在未进行微调或思维链提示的情况下,对ChatGPT进行零样本评估。
- 通过明确的定义与用法问题,直接探测ChatGPT对语言概念的知识掌握程度。
- 系统性地通过在预设触发词(如“他意识到……”)和非事实性动词(如“他们认为……”)下嵌入前提句,修改前提句。
- 对不同嵌入结构与对照条件下的推理准确率进行定量比较。
- 综合分析模型在多种推理类型中的行为,以检测系统性偏差与不一致性。

实验结果
研究问题
- RQ1ChatGPT能否在语法指定的蕴含关系中正确推断蕴含关系,例如将名词替换为“某人”?
- RQ2证据性副词(如“据称”)的存在如何影响ChatGPT对蕴含关系的判断能力?
- RQ3ChatGPT能否在简单的类别成员关系推理中正确应用单调性原则(上行/下行蕴含)?
- RQ4ChatGPT对语言概念的知识在多大程度上传递到了实际推理任务中?
- RQ5预设触发词或非事实性动词是否系统性地导致模型偏向预测蕴含,而无视语义上的真实性?
主要发现
- 尽管在直接提问时能正确解释概念,ChatGPT在语法指定的蕴含任务中仍表现出中等至低下的准确率。
- 该模型频繁无法识别‘据称’等证据性副词会阻断蕴含关系,即使前提存在不确定性,仍错误预测蕴含。
- ChatGPT在单调性蕴含任务中表现困难,常在简单的类别成员关系中错误地从子集推断到超集,或反之。
- 当前提句被嵌入预设触发词(如“他意识到……”)中时,模型显著更频繁地预测蕴含,即使语义内容与蕴含关系相悖。
- 同样,当前提句被嵌入非事实性动词(如“他们认为……”)中时,模型表现出强烈的蕴含预测偏差,无论正确的语义标签为何。
- 模型表现出知识应用的不一致性:它理解语言规则,却无法在推理任务中有效应用,表明其陈述性知识与推理能力之间存在鸿沟。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。