[论文解读] Evaluating statistical language models as pragmatic reasoners
本文通过测试大语言模型(LLMs)在虚构拔河游戏中对涉及可度形容词'strong'的语用性话语进行语境敏感、概率性解释的推断能力,评估其作为语用推理者的性能。LLMs 能够成功生成复杂语用表达(如'对初学者而言非常强')的人类类似分布,但在否定和极性反转方面表现不佳,表明其语用推理存在部分隐式分摊。
The relationship between communicated language and intended meaning is often probabilistic and sensitive to context. Numerous strategies attempt to estimate such a mapping, often leveraging recursive Bayesian models of communication. In parallel, large language models (LLMs) have been increasingly applied to semantic parsing applications, tasked with inferring logical representations from natural language. While existing LLM explorations have been largely restricted to literal language use, in this work, we evaluate the capacity of LLMs to infer the meanings of pragmatic utterances. Specifically, we explore the case of threshold estimation on the gradable adjective ``strong'', contextually conditioned on a strength prior, then extended to composition with qualification, negation, polarity inversion, and class comparison. We find that LLMs can derive context-grounded, human-like distributions over the interpretations of several complex pragmatic utterances, yet struggle composing with negation. These results inform the inferential capacity of statistical language models, and their use in pragmatic and semantic parsing applications. All corresponding code is made publicly available (https://github.com/benlipkin/probsem/tree/CogSci2023).
研究动机与目标
- 探究统计语言模型是否能通过恢复与语境相关的意义分布,隐式执行语用推理。
- 评估 LLM 在组合复杂语用意义(包括限定、否定和极性反转)方面的程度。
- 在受控的语义解析任务中,将 LLM 生成的解释分布与人类估算的分布进行比较。
- 探讨 LLM 是否通过预训练中学习到的统计模式,隐式分摊语用推理的计算成本,类似于人类推理。
提出的方法
- 本研究采用基于理性言语行为(RSA)模型的概率编程语言(PPL)框架,定义了具有数值先验的可能世界生成模型,用于玩家实力的建模。
- 将诸如'strong'、'very strong for a beginner'或'not strong'等话语视为对 PPL 的条件语句,以更新对玩家实力的后验信念。
- 通过提示 LLM 估算实力阈值的后验分布,模拟语用推理过程,而无需显式概率计算。
- 同时要求人类参与者估算相同的分布,从而实现与 LLM 输出的直接对比。
- 评估内容包括否定、极性反转以及类别比较,以检验对间接指涉和语境模糊性的鲁棒性。
- 使用 KL 散度和相关性度量,衡量 LLM 与人类分布之间的统计相似性。

实验结果
研究问题
- RQ1LLMs 是否能够推断出与语境相关的、类似人类的、关于可度形容词(如'strong')语用话语解释的分布?
- RQ2LLMs 在处理复杂结构(如限定('very strong')、否定('not strong')和极性反转('weak'))时,其语用意义的组合能力如何?
- RQ3LLMs 在语用推理任务中,对人类听者概率推理过程的近似程度如何?
- RQ4LLMs 是否隐式分摊了语用推理的计算成本,还是仅依赖预训练数据中的统计模式来生成启发式近似?
主要发现
- 对于复杂语用话语(如'对初学者而言非常强'),LLMs 生成的解释分布与人类估算的分布高度相似,相关性高(r > 0.8),KL 散度低。
- 该模型成功处理了语境敏感的比较和间接指涉,表现出对查询与上下文变量之间同义或非精确匹配的鲁棒性。
- LLMs 在否定处理上未能正确组合语义,生成的分布与人类推断显著偏离,表明在否定条件下组合推理能力出现崩溃。
- 否定处理中的差异表明,此类计算可能需要显式概率推理,而非依赖预训练数据中的启发式检索。
- LLMs 展现出强大的词汇语义鲁棒性,在处理语境模糊性方面优于基于组合范畴语法的传统语义解析器。
- 结果支持如下假设:LLMs 可能通过训练数据中的统计规律性,隐式分摊部分语用推理,但并非全部,特别是那些需要显式逻辑或概率操作的任务。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。