[论文解读] Evaluating the Deductive Competence of Large Language Models
本研究通过沃森选择任务评估大语言模型(LLMs)的演绎推理能力,检验内容类型(社会规则与非社会规则)和呈现格式对性能的影响。尽管在海量文本语料上进行了训练,LLMs在抽象问题上的准确率仍很低(10%-20%),在社会规则问题上仅获得有限提升,且性能受到内容与格式之间出人意料的、非人类特征的交互影响,表明其存在与人类认知不同的、新兴的推理偏差。
The development of highly fluent large language models (LLMs) has prompted increased interest in assessing their reasoning and problem-solving capabilities. We investigate whether several LLMs can solve a classic type of deductive reasoning problem from the cognitive science literature. The tested LLMs have limited abilities to solve these problems in their conventional form. We performed follow up experiments to investigate if changes to the presentation format and content improve model performance. We do find performance differences between conditions; however, they do not improve overall performance. Moreover, we find that performance interacts with presentation format and content in unexpected ways that differ from human performance. Overall, our results suggest that LLMs have unique reasoning biases that are only partially predicted from human reasoning performance and the human-generated language corpora that informs them.
研究动机与目标
- 评估LLMs是否能够解决认知科学中的经典演绎推理问题,特别是沃森选择任务。
- 探究社会规则内容是否如人类一样能提升LLM的性能。
- 考察不同呈现格式对LLM推理性能的影响。
- 确定性能差异是否在不同LLM架构和训练数据中保持一致。
- 识别与人类认知模式相异的LLM中新兴的推理偏差。
提出的方法
- 使用标准化、受控的问题集对多个LLM实施沃森选择任务,问题内容包括不同类别(社会性、现实性、任意性)和呈现格式(经典、打乱、重述)。
- 设计实验,在固定问题内容下改变格式,以隔离呈现方式对模型性能的影响。
- 测量模型响应的正确性,重点关注逻辑上有效的卡片选择(肯定前件式与否定后件式)。
- 对比不同架构、训练数据和目标的LLM之间的性能,以评估发现的一致性。
- 分析对前件与后件卡片的选择模式,以检测推理偏差。
- 采用受控的零样本提示,避免微调,确保评估模型的一般推理能力。

实验结果
研究问题
- RQ1LLM的演绎推理性能是否如人类一样因社会规则内容的引入而提升?
- RQ2不同呈现格式(如经典格式与打乱格式)如何影响LLM在沃森任务中的表现?
- RQ3LLM推理中是否存在内容类型与呈现格式之间一致的、非人类特征的交互?
- RQ4LLM在条件推理任务中在多大程度上复现了人类的推理模式?
- RQ5尽管架构和训练差异存在,LLM中的推理偏差是否在不同模型间保持一致?
主要发现
- LLMs在抽象沃森问题上的表现较低,准确率约为10%-20%,与人类基线表现一致。
- 社会规则问题上的表现略有提升,但未达到人类水平(70%以上),表明内容熟悉度带来的益处有限。
- 呈现格式显著影响性能,经典格式表现最佳,但提升幅度微小。
- 观察到内容与格式之间出人意料的、非人类特征的交互,表明存在人类认知模型无法预测的推理偏差。
- LLMs表现出不一致的卡片选择行为,尤其在非社会性和现实规则条件下,对前件卡片的选择表现较差。
- 尽管训练数据和架构存在差异,LLMs在性能模式和推理偏差上表现出惊人的一致性,表明存在新兴的、共享的认知偏差。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。