[论文解读] Recursion of Thought: A Divide-and-Conquer Approach to Multi-Context Reasoning with Language Models
本文提出了思维递归(Recursion of Thought, RoT),一种模型无关的推理框架,通过使用特殊标记(GO、STOP、THINK)将任务递归地划分为多个子上下文,使大型语言模型能够在超出其上下文长度限制的情况下解决复杂的推理问题。RoT使GPT-3等模型能够解决需要数十万推理标记的问题,在远超标准上下文限制的算术和算法任务上实现了近乎完美的准确率。
Generating intermediate steps, or Chain of Thought (CoT), is an effective way to significantly improve language models' (LM) multi-step reasoning capability. However, the CoT lengths can grow rapidly with the problem complexity, easily exceeding the maximum context size. Instead of increasing the context limit, which has already been heavily investigated, we explore an orthogonal direction: making LMs divide a problem into multiple contexts. We propose a new inference framework, called Recursion of Thought (RoT), which introduces several special tokens that the models can output to trigger context-related operations. Extensive experiments with multiple architectures including GPT-3 show that RoT dramatically improves LMs' inference capability to solve problems, whose solution consists of hundreds of thousands of tokens.
研究动机与目标
- 解决大型语言模型在解决复杂多步推理问题时面临的关键限制——固定上下文长度。
- 使语言模型能够解决其解决方案需要数十万标记的推理任务,超出标准上下文窗口。
- 提出一种无需架构修改或任务特定工具的模型无关推理框架。
- 探索一种可扩展至单上下文生成限制之外的分而治之推理策略。
提出的方法
- 引入三种特殊标记:GO(问题开始)、STOP(问题结束)和THINK(触发进入新上下文的递归)。
- 将每个推理上下文结构化为问题主干与子问题的问答组合,使用嵌套的GO-STOP对实现分层分解。
- 利用THINK标记启动递归推理过程,为每个子问题创建新上下文,同时保留主问题的上下文。
- 采用递归生成策略,使子问题在隔离状态下求解,其答案再整合进主解决方案流程。
- 设计了一个合成基准,包含八项算术与算法任务,可调节至极高难度(例如64位算术),用于评估长上下文推理能力。
- 端到端训练模型,战略性地生成这些特殊标记,实现在无需外部工具情况下的可扩展多上下文推理。
实验结果
研究问题
- RQ1语言模型是否仅通过自动生成的特殊标记,就能解决其上下文窗口远小于解决方案长度的推理问题?
- RQ2通过THINK标记实现的递归分解策略,在处理需要10万+标记推理步骤的问题时效果如何?
- RQ3RoT框架在超长推理任务上是否优于标准思维链(CoT)和基线提示(WT)?
- RQ4RoT是否能在无需任务特定适配的情况下,泛化至多种推理类型,包括算术、动态规划和字符串操作?
- RQ5RoT在极长问题上的性能上限是多少?其性能如何随模型大小和架构变化而扩展?
主要发现
- RoT在8位和16位加法与减法任务中实现100%准确率,即使推理步骤超过10万标记。
- 在64位加法与减法任务中,RoT保持100%准确率,而标准CoT完全失败(0%准确率),证明其可扩展性。
- 在乘法与除法任务中,RoT在32位问题上实现99.9%准确率,显著优于CoT和WT基线。
- 在LCS(最长公共子序列)和LPS(最长回文子序列)等算法问题中,RoT在长度达32时保持100%准确率,而CoT在长度超过12时即完全失败。
- 在0-1背包问题和矩阵链乘法(MCM)问题中,RoT在小规模实例上实现100%准确率,并在高难度任务中保持高性能(例如LPS长度56时准确率达99.8%),远超基线。
- 即使在LSTM架构模型上,RoT在12位加法任务中也实现98.6%准确率,而CoT完全失败,表明其在不同架构上的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。