Skip to main content
QUICK REVIEW

[论文解读] Learning From Mistakes Makes LLM Better Reasoner

Shengnan An, Zexiong Ma|arXiv (Cornell University)|Oct 31, 2023
Artificial Intelligence in Law被引用 5
一句话总结

本文提出LeMa方法,通过在错误-修正数据对上进行微调,提升大语言模型(LLMs)的 few-shot 推理能力,使模型从错误推理路径及其修正中学习。通过使用 GPT-4 生成高质量的修正数据,并应用以修正为中心的演化策略,LeMa 在多个 LLM 和任务上均提升了推理性能,在 GSM8K 和 MATH 基准测试中达到当前最优结果。

ABSTRACT

Large language models (LLMs) recently exhibited remarkable reasoning capabilities on solving math problems. To further improve their reasoning capabilities, this work explores whether LLMs can LEarn from MistAkes (LEMA), akin to the human learning process. Consider a human student who failed to solve a math problem, he will learn from what mistake he has made and how to correct it. Mimicking this error-driven learning process, LEMA incorporates mistake-correction data pairs during fine-tuning LLMs. Specifically, we first collect inaccurate reasoning paths from various LLMs, and then employ GPT-4 as a ''corrector'' to identify the mistake step, explain the reason for the mistake, correct the mistake and generate the final answer. In addition, we apply a correction-centric evolution strategy that effectively expands the question set for generating correction data. Experiments across various LLMs and reasoning tasks show that LEMA effectively improves CoT-alone fine-tuning. Our further ablations shed light on the non-homogeneous effectiveness between CoT data and correction data. These results suggest a significant potential for LLMs to improve through learning from their mistakes. Our code, models and prompts are publicly available at https://github.com/microsoft/LEMA.

研究动机与目标

  • 探究大语言模型(LLMs)是否能通过学习自身错误来提升推理能力,类似于人类的错误驱动学习。
  • 通过收集 LLM 在数学问题上的错误推理路径,并利用 GPT-4 作为校正者识别、解释并修正错误,生成高质量的错误-修正数据对。
  • 开发一种以修正为中心的演化策略,通过聚焦中等难度问题作为种子来扩展训练数据,以提升泛化能力。
  • 在多种开源 LLM 和推理任务(包括数学和常识推理)上评估 LeMa 的有效性。
  • 分析不同修正组件——错误步骤、解释和修正解法——对模型性能的贡献。

提出的方法

  • 从不同 LLM(如 LLaMA、GPT 系列)在数学问题上的推理路径中收集不准确的推理路径,作为错误示例。
  • 使用 GPT-4 作为“校正者”,生成三段式修正数据:(1) 错误步骤,(2) 解释其错误原因,(3) 包含正确最终答案的修正推理路径。
  • 通过人工评估筛选出最终答案错误的修正数据,以确保数据质量。
  • 应用以修正为中心的演化策略,选择中等难度的问题作为种子,生成新的修正数据,提升数据多样性与实用性。
  • 使用链式思维(CoT)数据与修正数据的混合数据集对 LLM 进行微调,使模型既能学习正确推理,也能学习错误修正。
  • 开展消融实验,以分离各修正组件的贡献,并评估数据选择策略。

实验结果

研究问题

  • RQ1LLMs 能否通过学习自身错误来提升推理能力,类似于人类的错误驱动学习?
  • RQ2LeMa 在不同 LLM 和推理任务上的性能与标准 CoT 微调相比如何?
  • RQ3修正数据中不同组件(错误步骤、解释、修正解法)对最终模型性能的相对贡献是什么?
  • RQ4在修正数据生成中,聚焦于中等难度问题是否比随机采样能获得更好结果?
  • RQ5在控制训练数据规模的前提下,混合使用 CoT 数据与修正数据,与仅使用单一数据源相比,表现如何?

主要发现

  • LeMa 在 LLaMA-2-70B 上于 GSM8K 达到 83.5%,在 MATH 上达到 25.0%,优于仅使用 CoT 微调的结果(分别为 81.4% 和 23.6%)。
  • 应用以修正为中心的演化策略后,LLaMA-2-70B 在 MATH 上的性能从 25.0% 提升至 29.3%。
  • LeMa 显著提升了专用模型如 WizardMath 和 MetaMath,展现出广泛的适用性。
  • 消融实验表明,若移除修正解法或解释,性能显著下降,而省略错误步骤影响较小,表明模型具备隐式错误定位能力。
  • 在训练数据规模恒定的前提下,混合使用 CoT 与修正数据优于单独使用任一数据类型,表明二者具有互补优势。
  • 中等难度问题在生成修正数据时比随机选择的问题更有效,因其能产生更高品质、更具实用性的修正。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。