Skip to main content
QUICK REVIEW

[论文解读] Solving Math Word Problems via Cooperative Reasoning induced Language Models

Xinyu Zhu, Junjie Wang|arXiv (Cornell University)|Oct 28, 2022
Topic Modeling被引用 4
一句话总结

本文提出 CoRe,一种协作推理框架,通过结合生成器(系统1)用于推理路径生成,以及验证器(系统2)在推理过程中提供逐步反馈,模拟人类双过程认知。通过在蒙特卡洛树搜索(MCTS)启发的循环中整合逐标记级别和逐句级别的验证器,CoRe 提升了推理质量,并在 MultiArith 数据集上实现了相较于最先进模型高达 9.6% 的相对性能提升,即使使用较小的模型亦可达成。

ABSTRACT

Large-scale pre-trained language models (PLMs) bring new opportunities to challenging problems, especially those that need high-level intelligence, such as the math word problem (MWPs). However, directly applying existing PLMs to MWPs can fail as the generation process lacks sufficient supervision and thus lacks fast adaptivity as humans. We notice that human reasoning has a dual reasoning framework that consists of an immediate reaction system (system 1) and a delicate reasoning system (system 2), where the entire reasoning is determined by their interaction. This inspires us to develop a cooperative reasoning-induced PLM for solving MWPs, called Cooperative Reasoning (CoRe), resulting in a human-like reasoning architecture with system 1 as the generator and system 2 as the verifier. In our approach, the generator is responsible for generating reasoning paths, and the verifiers are used to supervise the evaluation in order to obtain reliable feedback for the generator. We evaluate our CoRe framework on several mathematical reasoning datasets and achieve decent improvement over state-of-the-art methods, up to 9.6% increase over best baselines. Our codes are available at https://github.com/TianHongZXY/CoRe

研究动机与目标

  • 为解决现有大语言模型(LLMs)在求解数学应用题(MWPs)时缺乏泛化能力和适应性的问题。
  • 在神经模型中模拟人类双过程推理——快速直觉(系统1)与审慎验证(系统2)。
  • 通过在生成过程中引入反馈而非仅在最终答案阶段进行反馈,提升推理路径质量。
  • 通过自思考策略实现零样本和微调推理,生成高质量、自监督的推理路径。

提出的方法

  • 该框架使用生成器(系统1)逐标记生成推理路径,建模为一系列概率决策序列。
  • 引入两类验证器——逐标记级别和逐句级别——在生成过程中实时评分推理步骤。
  • 验证器通过类似 MCTS 的树搜索提供反馈,实现对高质量推理路径的动态评估与选择。
  • 训练目标结合推理路径困惑度与解题得分,使生成过程与逻辑连贯性及正确性对齐。
  • 采用自思考策略,利用 CoRe 自身生成器和验证器生成的合成数据,无需外部监督即可提升推理能力。
  • 该方法在闭环生成过程中运行,验证器的反馈持续引导生成器迭代优化,直至最终确定答案。

实验结果

研究问题

  • RQ1能否通过模仿人类双过程认知的协作推理框架提升数学应用题上的推理性能?
  • RQ2在推理路径生成过程中引入实时反馈,相较于序列末端评估,如何影响模型的泛化能力和准确性?
  • RQ3在该协作验证机制下,小型语言模型在多大程度上可超越远大于其参数量的模型?
  • RQ4基于模型生成数据的自思考能否在无需大规模标注数据集的情况下提升推理能力?

主要发现

  • CoRe 在 MultiArith 数据集上实现了相较于最佳现有基线模型 9.6% 的相对性能提升,表明即使使用较小模型,仍具备强大的泛化能力。
  • 该框架在多个数学推理数据集上,无论在零样本还是微调设置中,均显著优于标准 PLMs。
  • 在标记级别和句子级别集成验证器,可实现对错误推理路径的早期检测,减少对最终答案正确性的依赖。
  • 自思考策略提升了推理能力,使模型能够纠正自身推理中的错误,如定性示例所示。
  • 该方法具备跨数据集泛化能力:在未见过的算术数据集上实现的零样本性能,证实了推理技能的可迁移性。
  • 即使仅使用来自 GSM8K 的 7.5K 个训练样本,CoRe 也展现出强大的推理迁移能力,表明其在推理任务适应中具有低数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。