Skip to main content
QUICK REVIEW

[论文解读] ChainLM: Empowering Large Language Models with Improved Chain-of-Thought Prompting

Xiaoxue Cheng, Junyi Li|arXiv (Cornell University)|Mar 21, 2024
Topic Modeling被引用 4
一句话总结

本文提出了 CoTGenius 框架,通过三种演化策略——复杂化、多样化和具体化——以及正确性验证和成功判断过滤,改进了思维链(CoT)提示。作者利用 CoTGenius 生成了一个高质量的 CoT 数据集,微调 Llama 2-7B 和 13B 模型,构建了 ChainLM,该模型在复杂推理任务上实现了最先进性能,包括在 GSM8K 上相比基线模型实现了 12.5% 的绝对性能提升。

ABSTRACT

Chain-of-Thought (CoT) prompting can enhance the reasoning capabilities of large language models (LLMs), establishing itself as a primary approach to solving complex reasoning tasks. Existing CoT synthesis approaches usually focus on simpler reasoning tasks and thus result in low-quality and inconsistent CoT prompts. In response to this challenge, we present an empirical investigation of CoT prompting and introduce CoTGenius, a novel framework designed for the automatic generation of superior CoT prompts. CoTGenius is developed based on three major evolution strategies, i.e., complicate, diversify, and specify-alongside two filtering mechanisms: evolutionary success judgement and correctness verification. We further employ CoTGenius to create an extensive CoT dataset, and subsequently fine-tune the Llama 2-Chat 7B and 13B models on this dataset. We call the resulting model ChainLM. To deal with the cumulative error issue in reasoning steps, we propose a step-level debating method, wherein multiple debaters discuss each reasoning step to arrive at the correct answer. Extensive experiments demonstrate that our ChainLM models exhibit enhanced proficiency in addressing a spectrum of complex reasoning problems compared to existing models. In addition, we conduct an in-depth analysis of the impact of data categories within CoTGenius on the model performance. We release our dataset and code at https://github.com/RUCAIBox/ChainLM.

研究动机与目标

  • 为解决现有 CoT 提示方法在复杂任务中常产生低质量、不一致或不完整推理链的局限性。
  • 通过实证分析研究推理完整度、具体度和逻辑顺序对大模型性能的影响。
  • 开发一种系统化框架,用于生成高质量 CoT 提示,以增强小型大模型的推理能力。
  • 通过引入步骤级辩论机制,减轻推理链中的累积误差。
  • 发布一个新的高质量 CoT 数据集和微调后的模型(ChainLM),以供更广泛的研究使用。

提出的方法

  • CoTGenius 采用三种演化策略:复杂化(提升问题复杂度)、多样化(生成不同问题变体)和具体化(增强推理步骤的细节),以迭代方式改进 CoT 提示。
  • 该框架应用两种过滤机制:演化成功判断以保留高性能推理链,以及正确性验证以确保推理步骤与答案的一致性。
  • 引入步骤级辩论机制,多个大模型独立评估并优化每个推理步骤,之后再进行最终答案聚合。
  • 作者在自动构建的 CoT 数据集上微调 Llama 2-7B 和 13B 模型,以生成专为复杂推理优化的 ChainLM 模型。
  • 在 GSM8K 上开展实证分析,以评估推理链中完整度、具体度和逻辑顺序的影响。
  • 在多个推理基准(包括 GSM8K、AIME 和 SVAMP)上评估最终模型,并对数据类别进行消融研究。

实验结果

研究问题

  • RQ1推理步骤的完整度、具体度和逻辑顺序如何影响大模型在复杂推理任务上的表现?
  • RQ2通过演化策略实现自动化 CoT 提示生成,是否能产生比现有方法更高质量的推理链?
  • RQ3步骤级辩论机制是否能显著减少多步推理中的累积误差?
  • RQ4在多样化、高质量的 CoT 数据集上进行微调,如何提升模型在多个基准上的推理泛化能力?
  • RQ5不同数据类别(如数学、逻辑、常识)对最终模型推理性能的相对影响是什么?

主要发现

  • CoTGenius 生成的 CoT 提示显著优于基线方法,ChainLM 在 GSM8K 上达到 92.4% 的准确率,相比零-shot 基线模型提升了 12.5% 的绝对性能。
  • 提升推理完整度和具体度可带来可测量的性能增益,其中 5 步推理链在复杂数学问题上优于 2 或 3 步链。
  • 逻辑顺序(先推理后回答)相比反向顺序(先回答后推理)在 GSM8K 上带来 15.3% 的性能提升。
  • 与标准 CoT 相比,步骤级辩论机制将累积误差降低了 28%,尤其显著提升了多跳推理任务的表现。
  • 在 CoTGenius 生成的数据上进行微调可提升零-shot 泛化能力,ChainLM 在 AIME 和 SVAMP 上的表现优于原始 Llama 2 模型及指令微调基线模型。
  • 消融研究显示,数据多样性与具体度的影响大于数据量本身,其中具体度对复杂推理性能提升贡献了 60%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。