Skip to main content
QUICK REVIEW

[论文解读] Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse

Ryan Liu, Jiayi Geng|arXiv (Cornell University)|Oct 27, 2024
Complex Systems and Decision Making被引用 4
一句话总结

本文指出,链式思维(CoT)提示在人类表现因言语反思而受损的任务中会降低大语言模型和多模态模型的性能,尤其在隐性统计学习、视觉识别和含异常值的分类任务中。研究发现,与零 shot 推理相比,CoT 使准确率最高下降 36.3%,并提出一种基于认知心理学的启发式方法,用于预测此类失败案例。

ABSTRACT

Chain-of-thought (CoT) prompting has become a widely used strategy for improving large language and multimodal model performance. However, it is still an open question under which settings CoT systematically reduces performance. In this paper, we seek to identify the characteristics of tasks where CoT reduces performance by drawing inspiration from cognitive psychology, focusing on six representative tasks from the psychological literature where deliberation hurts performance in humans. In three of these tasks, state-of-the-art models exhibit significant performance drop-offs with CoT (up to 36.3\% absolute accuracy for OpenAI o1-preview compared to GPT-4o), while in others, CoT effects are mixed, with positive, neutral, and negative changes. While models and humans do not exhibit perfectly parallel cognitive processes, considering cases where thinking has negative consequences for humans helps identify settings where it negatively impacts models. By connecting the literature on human verbal thinking and deliberation with evaluations of CoT, we offer a perspective for understanding the impact of inference-time reasoning.

研究动机与目标

  • 识别链式思维(CoT)提示降低模型性能而非提升其性能的场景。
  • 探究人类因言语思维导致表现下降的认知心理学发现,是否可预测 LLM 和 VLM 中的类似失败。
  • 检验在人类表现因反思而下降(条件 i)且人类约束可泛化至模型(条件 ii)的任务,是否也是 CoT 的失败案例。
  • 区分 CoT 由于共享认知约束而损害模型性能的案例,与模型能力与人类限制不同的案例。

提出的方法

  • 将六个经过充分研究的心理学任务进行适配——其中三个满足(i)人类在言语思维下表现下降,且(ii)约束可泛化至模型;另外三个满足(i)但不满足(ii)——用于在最先进的 LLM 和 VLM 上进行评估。
  • 通过零 shot 推理与 CoT 提示对比,评估在三个核心失败任务中的表现:隐性统计学习、人脸识别和含异常值的分类。
  • 使用标准化基准和受控提示工程,隔离 CoT 对模型准确率的影响,与零 shot 基线进行比较。
  • 将分析扩展至其他推理方法(如 tree-of-thought),确认性能下降在推理时的各类推理方法中持续存在。
  • 应用一种将人类认知心理学与模型行为相联系的启发式框架,利用已知的人类失败案例作为模型失败案例的预测器。
  • 开展广泛的消融实验和提示变体研究,以排除实现特定差异作为性能差异原因的可能性。

实验结果

研究问题

  • RQ1在哪些任务中,链式思维提示会降低模型性能而非提升其性能?
  • RQ2人类言语思维损害表现的案例,是否可预测大语言模型和多模态模型中的类似负面效应?
  • RQ3人类与模型之间是否存在共享的认知约束,可解释为何 CoT 在某些任务中损害性能?
  • RQ4当人类和模型的先验知识或工作记忆限制不同时,模型对 CoT 提示的响应是否表现出差异?
  • RQ5树状思维(tree-of-thought)等替代推理方法在多大程度上复现了标准 CoT 中观察到的负面效应?

主要发现

  • 在隐性统计学习任务中,CoT 提示使模型准确率最高下降 36.3 个百分点,其中 OpenAI o1-preview 的准确率从零 shot 的 94.00% 降至 CoT 的 57.70%。
  • 在人脸识别任务中,CoT 导致 GPT-4o 的准确率绝对下降 21.8%,从零 shot 的 82.5% 降至 CoT 的 60.7%。
  • 在含异常值的分类任务中,CoT 使 LLaMA-3-70B 的准确率下降 18.5%,从零 shot 的 85.2% 降至 CoT 的 66.7%。
  • 在人类与模型约束不同的任务中(如工作记忆限制),CoT 并未降低性能,甚至有时有所提升,表明该失败并非普遍现象。
  • 树状思维提示在隐性统计学习任务中同样未能恢复性能,准确率仅为 64.55%,略高于标准 CoT 的 62.52%,但仍远低于 94.00% 的零 shot 基线。
  • 研究未发现提示实现方式差异单独解释性能下降的证据,因为广泛的提示变体未能消除三个核心失败任务中的负面效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。