Skip to main content
QUICK REVIEW

[论文解读] Boosting Logical Reasoning in Large Language Models through a New Framework: The Graph of Thought

Bin Lei, pei-Hung Lin|arXiv (Cornell University)|Aug 16, 2023
Topic Modeling被引用 5
一句话总结

本文提出了思维图(GoT)这一新型提示工程框架,通过将推理路径建模为动态、相互连接的图结构,而非线性或树状结构,从而提升大语言模型的逻辑推理能力。通过支持从目标出发的双向推理、验证思维之间的连接关系,并迭代优化图结构,GoT在24点游戏中实现了97%的准确率,较GPT-4高出89.7个百分点,较SOTA方法ToT高出23个百分点,展现出在多步逻辑推理任务中的最先进性能。

ABSTRACT

Recent advancements in large-scale models, such as GPT-4, have showcased remarkable capabilities in addressing standard queries. However, when facing complex problems that require multi-step logical reasoning, their accuracy dramatically decreases. Current research has explored the realm of extit{prompting engineering} to bolster the inferential capacities of these models. Our paper unveils a pioneering prompting technique, dubbed extit{Graph of Thoughts (GoT)}. Through testing on a trio of escalating challenges: the 24-point game, resolution of high-degree polynomial equations, and derivation of formulas for recursive sequences, our method outperformed GPT-4, achieving accuracy improvements of $89.7\%$, $86\%$, and $56\%$ for each respective task. Moreover, when juxtaposed with the state-of-the-art (SOTA) prompting method, extit{Tree of Thought (ToT)}, our approach registered an average accuracy boost of $23\%$, $24\%$, and $15\%$.

研究动机与目标

  • 为解决大语言模型在执行复杂、结构化问题时多步逻辑推理能力持续受限的问题。
  • 克服现有提示方法(如思维链CoT和思维树ToT)所受的层级化与线性结构限制。
  • 通过支持双向、互联的推理路径,开发更贴近人类认知过程的推理框架。
  • 提升在需要递归推理、方程变换与代数洞察力的任务中的推理准确性。

提出的方法

  • GoT将推理建模为动态的非层级图结构,其中每个节点代表一个思维或中间推理步骤。
  • 该框架从期望的结果出发启动推理,而非初始条件,从而实现目标导向的探索。
  • 通过检查机制连接思维,验证节点间转换的逻辑一致性和正确性。
  • 通过图结构更新机制实现迭代优化,基于新见解重新评估并重新添加有前景的推理路径。
  • 该方法整合了变量变换、公式简化等数学工具,以提升推导的准确性。
  • 采用深度受限的遍历策略,并通过多轮检查(n轮)探索多样化的推理路径,选择最一致的路径。
Figure 1: Comparison of various prompting approaches.
Figure 1: Comparison of various prompting approaches.

实验结果

研究问题

  • RQ1非层级的、基于图的推理结构是否能在复杂逻辑推理任务中超越线性或树状提示方法?
  • RQ2从解向后进行的目标导向推理,相比仅向前推理,能否显著提升大语言模型的准确性?
  • RQ3思维连接的验证机制在多步推理中能在多大程度上减少逻辑错误?
  • RQ4通过多轮检查实现的迭代图结构优化,是否能显著提升推理结果?
  • RQ5在基于图的框架中整合数学工具,是否能进一步提升代数与递归推理问题的性能?

主要发现

  • GoT在24点游戏中实现了97%的准确率,较GPT-4的7.3%高出89.7个百分点,较SOTA方法ToT高出23个百分点。
  • 在求解高次多项式方程方面,GoT相较GPT-4准确率提升86%,较ToT高出24个百分点。
  • 在推导递归数列公式方面,当启用数学工具时,GoT达到57%的准确率,较ToT高出15个百分点,较GPT-4高出56个百分点。
  • 随着检查轮数(n)的增加,该方法性能持续提升,在n=5时达到55%准确率,启用数学工具后提升至57%。
  • GoT在所有三项任务中均优于所有基线方法,展现出在多步逻辑推理任务中的稳定优势。
  • 该框架通过验证思维间连接关系并迭代优化图结构,显著减少了逻辑不一致,提升了最终解的质量。
Figure 2: A toy example for the Graph of thought
Figure 2: A toy example for the Graph of thought

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。