Skip to main content
QUICK REVIEW

[论文解读] LogiCoT: Logical Chain-of-Thought Instruction-Tuning

Hanmeng Liu, Zhiyang Teng|arXiv (Cornell University)|May 20, 2023
Topic Modeling被引用 4
一句话总结

LogiCoT 引入了一个大规模、指令微调的逻辑思维链(CoT)推理数据集,该数据集使用 GPT-4 生成多样化、多步骤的推理示例。使用 LogiCoT 对 LLaMA-7b 进行微调,在逻辑推理基准测试中显著提升性能,LogiEval 达到 40.7%,MMLU 达到 43.3%,优于当前最先进的指令微调模型。

ABSTRACT

Generative Pre-trained Transformer 4 (GPT-4) demonstrates impressive chain-of-thought reasoning ability. Recent work on self-instruction tuning, such as Alpaca, has focused on enhancing the general proficiency of models. These instructions enable the model to achieve performance comparable to GPT-3.5 on general tasks like open-domain text generation and paraphrasing. However, they fall short of helping the model handle complex reasoning tasks. To bridge the gap, this paper presents LogiCoT, a new instruction-tuning dataset for Logical Chain-of-Thought reasoning with GPT-4. We elaborate on the process of harvesting instructions for prompting GPT-4 to generate chain-of-thought rationales. LogiCoT serves as an instruction set for teaching models of logical reasoning and elicits general reasoning skills.

研究动机与目标

  • 解决开源大语言模型中缺乏多样化、复杂逻辑推理指令数据的问题。
  • 弥合 GPT-4 等专有模型与开源模型在多步逻辑推理能力之间的差距。
  • 开发一种可扩展的、自监督的方法,利用 GPT-4 生成高质量的 CoT 推理数据。
  • 证明使用丰富逻辑推理数据进行指令微调,可同时提升小型大语言模型在专业和通用推理任务中的能力。
  • 向社区发布 LogiCoT 数据集及微调后的 LLaMA-7b 模型,以供进一步研究使用。

提出的方法

  • 通过提示现有逻辑推理数据集,利用 GPT-4 生成思维链推理过程。
  • 通过重新利用现有逻辑推理数据并应用 GPT-4 生成结构化、多步骤的推理输出,构建多样化指令微调数据集。
  • 设计涵盖多种推理类型的指令模板:语言到逻辑的映射、单步推理、推理链以及多选题推理。
  • 收集了 70,000 个训练样本,涵盖符号推理和复杂多步逻辑推导。
  • 使用标准指令微调目标,基于 LogiCoT 数据集对 LLaMA-7b 模型进行微调,以提升其推理泛化能力。
  • 开展消融实验,评估各类推理类型对整体模型性能的贡献。
Figure 1: A showcase of using GPT-4 and existing inference data to generate CoT rationales for logical reasoning.
Figure 1: A showcase of using GPT-4 and existing inference data to generate CoT rationales for logical reasoning.

实验结果

研究问题

  • RQ1GPT-4 是否能有效用于生成高质量、多样化的思维链推理示例,以供指令微调使用?
  • RQ2使用聚焦于逻辑推理的指令微调数据集,如何提升模型在推理基准测试中的表现?
  • RQ3不同推理类型(如推理链、多选题)对整体推理性能的相对贡献如何?
  • RQ4当在专用 CoT 数据集上微调时,小型开源大语言模型(如 LLaMA-7b)在多大程度上能实现具有竞争力的推理性能?
  • RQ5LogiCoT 数据集是否能泛化到专业逻辑推理任务以及更广泛的人类中心型基准测试?

主要发现

  • LogiCoT 指令微调后的 LLaMA-7b 模型在 LogiEval 基准测试中达到 40.7% 的准确率,显著优于先前的指令微调模型。
  • 在 MMLU 基准测试中,该模型达到 43.3% 的准确率,表明其在多样化推理任务中具有强大的泛化能力。
  • 消融实验表明,移除‘推理链’推理类型导致性能下降最大(LogiEval 上下降 30.8%),凸显其在多步推理中的关键作用。
  • 在 MMLU 上,移除‘多选题’推理类型的影响最为显著(准确率降至 30.9%),表明其在多选逻辑任务中的重要性。
  • 案例研究显示,模型在正确案例中能生成连贯的推理过程,但在复杂问题中偶尔会引入错误约束或跳过选项评估。
  • 尽管模型性能仍低于 GPT-4,表明仍有改进空间,但其已为开源推理模型建立了强有力的基线。
Figure 2: An instance from the LogicInference dataset.
Figure 2: An instance from the LogicInference dataset.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。