[论文解读] LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models
该论文提出了AutoRace,一种利用GPT-4评估逻辑正确性的自动化、任务自适应评估框架,用于评估大语言模型生成的推理链。同时,论文还提出了LLM Reasoners,一个统一的库,通过搜索-奖励-世界模型的建模范式标准化推理算法,实现系统的比较。关键结果表明,与仅基于答案的评估相比,AutoRace检测到70.4%的错误推理链;在Blocksworld任务中,结合世界模型的RAP比ToT高出42%。
Generating accurate step-by-step reasoning is essential for Large Language Models (LLMs) to address complex problems and enhance robustness and interpretability. Despite the flux of research on developing advanced reasoning approaches, systematically analyzing the diverse LLMs and reasoning strategies in generating reasoning chains remains a significant challenge. The difficulties stem from the lack of two key elements: (1) an automatic method for evaluating the generated reasoning chains on different tasks, and (2) a unified formalism and implementation of the diverse reasoning approaches for systematic comparison. This paper aims to close the gap: (1) We introduce AutoRace for fully automated reasoning chain evaluation. Existing metrics rely on expensive human annotations or pre-defined LLM prompts not adaptable to different tasks. In contrast, AutoRace automatically creates detailed evaluation criteria tailored for each task, and uses GPT-4 for accurate evaluation following the criteria. (2) We develop LLM Reasoners, a library for standardized modular implementation of existing and new reasoning algorithms, under a unified formulation of the search, reward, and world model components. With the new evaluation and library, (3) we conduct extensive study of different reasoning approaches (e.g., CoT, ToT, RAP). The analysis reveals interesting findings about different factors contributing to reasoning, including the reward-guidance, breadth-vs-depth in search, world model, and prompt formats, etc.
研究动机与目标
- 为解决当前大语言模型推理链缺乏自动化、任务自适应评估的问题,该问题目前依赖于昂贵的人工标注或不可适应的提示。
- 将多种推理算法(如CoT、ToT和RAP)统一于同一形式化框架下,以实现系统性比较与实现。
- 分析影响推理性能的关键因素,包括奖励引导、搜索广度与深度、世界模型使用以及提示设计。
- 使用答案准确率和推理质量指标,评估领先大语言模型(如GPT-4、Claude-3、Llama-2)的推理能力。
- 揭示推理链中的任务特定失败模式,例如在常识任务中,由于提示过于详细,RAP产生事实幻觉。
提出的方法
- AutoRace通过使用GPT-4总结大语言模型生成的推理链中的错误,自动生成任务特定的评估标准,实现无需人工介入的动态、自适应评估。
- 评估标准用于指导GPT-4在每个任务基础上评估推理链的逻辑一致性、事实准确性及逐步连贯性。
- LLM Reasoners将推理形式化为在推理状态空间上的搜索过程,由奖励函数、世界模型和搜索算法(如束搜索、MCTS)参数化。
- 该库提供模块化、可组合的奖励、世界模型和搜索组件,具有标准化API和可视化功能,以支持可复现性和可扩展性。
- 统一的建模范式使得现有方法(如CoT、ToT、RAP)可映射为三个核心组件的特定配置。
- 该框架支持新推理算法的即插即用集成,并支持对设计因素的受控消融研究。
实验结果
研究问题
- RQ1如何在不依赖人工标注参考或固定提示的前提下,实现对多样化任务中推理链的自动化、准确评估?
- RQ2哪些关键设计因素(如奖励引导、搜索策略、世界模型和提示格式)影响大语言模型推理的质量?
- RQ3在不同任务中,不同推理算法(如CoT、ToT、RAP)在推理链正确性和最终答案准确率方面如何比较?
- RQ4领先大语言模型(如GPT-4、Claude-3)在推理质量方面存在多大差异,这些差异背后的原因是什么,且这些差异是否超出了最终答案准确率的范畴?
- RQ5在需要对长序列进行状态追踪的任务中,世界模型的引入在多大程度上影响推理性能?
主要发现
- 与仅基于最终答案的评估相比,AutoRace检测到70.4%的错误推理链,显示出与人工评估的强相关性。
- 在StrategyQA任务中,39%的推理链虽然答案正确,但包含逻辑或事实错误,凸显了专门针对推理的评估的必要性。
- 在Blocksworld任务中,结合世界模型的RAP比ToT高出42%,表明显式状态追踪能显著提升长程规划中的推理能力。
- 提示格式对推理质量有关键影响:RAP的迭代子问题提示方式增加了事实幻觉(如错误数字7,000),尤其在常识任务中更为明显。
- GPT-4 Turbo和Claude-3 Opus在各项任务中推理能力领先,尽管与较弱模型在答案准确率上相似,但GPT-4在StrategyQA上的AutoRace得分为0.91,显示出更优的推理质量。
- 根据AutoRace得分对模型的排名与仅基于答案的排名存在显著差异,揭示了推理质量是独立于答案正确性的关键能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。