[论文解读] Reasoning with Language Model Prompting: A Survey
本综述全面概述了大语言模型提示推理,将方法分类为策略增强型、过程优化型和知识增强型。研究表明,链式思维(chain-of-thought)和自一致性提示(self-consistency prompting)等技术显著提升了算术、常识和符号推理任务的性能,当前最先进模型在GSM8K和CommonsenseQA等基准测试中已接近人类水平表现。
Reasoning, as an essential ability for complex problem-solving, can provide back-end support for various real-world applications, such as medical diagnosis, negotiation, etc. This paper provides a comprehensive survey of cutting-edge research on reasoning with language model prompting. We introduce research works with comparisons and summaries and provide systematic resources to help beginners. We also discuss the potential reasons for emerging such reasoning abilities and highlight future research directions. Resources are available at https://github.com/zjunlp/Prompt4ReasoningPapers (updated periodically).
研究动机与目标
- 系统性地整理并分析大语言模型提示推理领域的最新进展。
- 识别并分类提升大语言模型推理能力的关键提示策略。
- 提供推理方法的结构化分类法,包括策略增强型、过程优化型和知识增强型方法。
- 突出该领域尚未解决的挑战及未来研究方向。
- 为研究人员和初学者提供精选资源与基准测试。
提出的方法
- 提出将推理提示方法分为三大类的分类法:策略增强型、过程优化型和知识增强型推理。
- 将策略增强型方法进一步划分为单阶段(如链式思维、零样本链式思维)和多阶段(如从少到多、自问)提示策略。
- 引入过程优化技术,包括自我优化(如校准器、人机反馈)、集成优化(如自一致性、多样化采样)和迭代优化(如Reflexion、自精炼)。
- 涵盖外部引擎集成,包括代码解释器(如PAL、COCOGEN)和物理模拟器(如Mind’s Eye),通过外部工具增强推理能力。
- 探讨通过隐式(如生成知识、微调链式思维)和显式(如逻辑求解器、投票-k)知识注入实现的知识增强型推理。
- 使用GSM8K、CommonsenseQA和MATH等基准数据集评估并比较不同方法的推理性能。
实验结果
研究问题
- RQ1哪些关键提示策略使大语言模型能够执行复杂推理?
- RQ2在不同推理任务中,链式思维、自一致性及工具增强型提示等技术的性能表现如何比较?
- RQ3外部知识或工具(如代码解释器、模拟器)在增强推理能力方面发挥什么作用?
- RQ4为何某些提示方法在算术、常识和符号推理等多样化推理任务中具有更好的泛化能力?
- RQ5当前提示推理方法存在哪些局限性与开放挑战?未来研究应聚焦于何处?
主要发现
- 链式思维提示在GSM8K等算术任务中显著提升推理性能,模型在少样本设置下准确率超过80%。
- 自一致性与迭代精炼方法(如Self-Refine、Reflexion)通过聚合或优化多个推理路径,提升了推理的可靠性。
- 基于代码解释器的提示方法(如PAL、COCOGEN)通过生成并执行可执行代码,实现了对符号与数学推理的高精度执行。
- ChatGPT在GSM8K和CommonsenseQA上展现出强大的零样本推理能力,无需上下文示例即可生成分步解释并得出正确答案。
- 符号推理任务如末字母连接(Last Letter Concatenation)在ChatGPT中表现较弱,表明推理能力在不同类型推理中并非均匀分布。
- 本综述指出,通过生成知识或显式知识注入的知识增强型提示,可显著提升在常识推理与逻辑推理基准上的表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。