[论文解读] A fine-grained comparison of pragmatic language understanding in humans and language models
本研究通过在专家精心整理的英文材料上使用零样本提示,对人类与语言模型(LM)在七种语用语言现象上的表现进行了细粒度比较。像 Flan-T5 (XL) 和 text-davinci-002 这类大型模型表现出高准确率,并复现了人类的错误模式——更倾向于字面解释而非基于启发式的干扰项,表明语用行为可能在无需显式心理状态表征的情况下涌现;尽管如此,模型在理解反语、幽默以及社会期望违背现象方面仍存在困难。
Pragmatics and non-literal language understanding are essential to human communication, and present a long-standing challenge for artificial language models. We perform a fine-grained comparison of language models and humans on seven pragmatic phenomena, using zero-shot prompting on an expert-curated set of English materials. We ask whether models (1) select pragmatic interpretations of speaker utterances, (2) make similar error patterns as humans, and (3) use similar linguistic cues as humans to solve the tasks. We find that the largest models achieve high accuracy and match human error patterns: within incorrect responses, models favor literal interpretations over heuristic-based distractors. We also find preliminary evidence that models and humans are sensitive to similar linguistic cues. Our results suggest that pragmatic behaviors can emerge in models without explicitly constructed representations of mental states. However, models tend to struggle with phenomena relying on social expectation violations.
研究动机与目标
- 评估大型语言模型在无需微调的情况下,通过零样本提示能否恢复话语的语用解释。
- 调查当语言模型未能选择正确语用解释时,是否与人类产生类似的错误。
- 检查模型与人类在解决语用歧义时是否依赖相同的语言线索。
- 探索模型中的语用能力是否可在未显式构建心理状态表征的情况下涌现。
- 识别模型在理解涉及社会规范、期望以及反语等现象时的薄弱环节。
提出的方法
- 使用零样本提示评估语言模型在涵盖多种语用现象的 72 道多项选择题上的表现。
- 采用四种不同语言模型:GPT-2、T5-Instruct、Flan-T5 (XL) 和 InstructGPT (text-davinci-002),涵盖不同规模与训练目标。
- 从经过专家验证的刺激材料中收集人类反应数据,以建立基线错误模式与线索敏感度。
- 对模型响应进行细粒度分析,比较选择分布、错误类型(字面解释 vs. 启发式干扰项)以及对人类模式的线索敏感度。
- 使用由专家研究人员手工整理的数据集,以确保涵盖反语、间接请求和标量隐含等现象的语言与语用有效性。
- 通过统计度量比较模型与人类的响应分布,评估在正确答案与错误模式上的相似性。
实验结果
研究问题
- RQ1在零样本设置下,语言模型能否恢复说话者话语的预期语用解释?
- RQ2当语言模型出错时,它们是否与人类一样,倾向于选择字面解释而非基于启发式的干扰项?
- RQ3在解决语用歧义时,语言模型与人类是否对相同的语言线索敏感?
- RQ4语言模型是否可在未显式构建代理心理状态表征的情况下,涌现出语用行为?
- RQ5模型在依赖社会期望违背的现象(如反语与幽默)上的表现如何?
主要发现
- 最大型模型,尤其是 Flan-T5 (XL) 和 OpenAI 的 text-davinci-002,在语用理解任务中表现出高准确率,性能接近人类水平。
- 当出错时,模型主要选择字面解释,而非基于启发式的干扰项,与人类参与者观察到的错误模式一致。
- 有初步证据表明,模型与人类在解决语用歧义时对相似的语言线索具有敏感性。
- 模型在涉及社会期望违背的现象(如反语、幽默和会话准则)方面表现尤为困难。
- 结果表明,语用能力可在语言模型中涌现,而无需显式构建心理状态或信念更新的表征。
- 尽管准确率较高,模型在实际部署中仍不可预测,尤其是对于 text-davinci-002 等基于 API 的模型,因其训练协议缺乏透明度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。