[论文解读] Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization
Retroformer 引入了一种基于策略梯度的框架,通过分析过往失败并生成可操作的反馈,微调一个回溯语言模型,以提升大型语言智能体的性能。通过在不访问执行者模型参数的情况下学习环境奖励,它在 HotPotQA 上以 4 次尝试将任务成功率提升 18%,优于缺乏基于梯度优化的基线方法。
Recent months have seen the emergence of a powerful new trend in which large language models (LLMs) are augmented to become autonomous language agents capable of performing objective oriented multi-step tasks on their own, rather than merely responding to queries from human users. Most existing language agents, however, are not optimized using environment-specific rewards. Although some agents enable iterative refinement through verbal feedback, they do not reason and plan in ways that are compatible with gradient-based learning from rewards. This paper introduces a principled framework for reinforcing large language agents by learning a retrospective model, which automatically tunes the language agent prompts from environment feedback through policy gradient. Specifically, our proposed agent architecture learns from rewards across multiple environments and tasks, for fine-tuning a pre-trained language model which refines the language agent prompt by summarizing the root cause of prior failed attempts and proposing action plans. Experimental results on various tasks demonstrate that the language agents improve over time and that our approach considerably outperforms baselines that do not properly leverage gradients from the environment. This demonstrates that using policy gradient optimization to improve language agents, for which we believe our work is one of the first, seems promising and can be applied to optimize other models in the agent architecture to enhance agent performances over time.
研究动机与目标
- 为解决现有语言智能体中缺乏环境奖励优化的问题,这些智能体通常依赖不可微分的言语反馈。
- 通过训练一个回溯模型来分析失败并生成可操作的见解,实现语言智能体中的基于梯度的学习。
- 开发一个即插即用的模块,提升智能体性能,而无需访问主执行者 LLM 的参数或通过其反向传播梯度。
- 探究基于策略梯度的优化是否能增强语言智能体在多样化环境和任务中的推理与规划能力。
- 通过训练一个专门的回溯模型以实现精确的信用分配和根本原因分析,克服冻结 LLM 在自我反思中的局限性。
提出的方法
- 该框架使用一个通过策略梯度优化进行微调的回溯模型 $M_r$,利用来自环境的奖励,将执行者 LLM 视为环境的一部分。
- 回溯模型生成文本反馈,总结先前失败的根本原因,并为下一次尝试提出修改后的行为计划。
- 该方法通过将执行者 LLM 视为黑箱环境,避免对执行者 LLM 进行反向传播,仅在回溯模型上进行梯度更新。
- 回溯模型在离线的经验轨迹上进行训练,利用 HotPotQA 等环境的奖励,以优化其生成有效、结构化反思的能力。
- 该模型学会生成两部分响应:对失败的反思和新的可操作计划,其结构在无显式监督的情况下自然浮现。
- 该方法具有模块化和无偏见的特性,可与任何基于云的 LLM(如 GPT 或 Bard)集成,并可扩展至其他组件(如记忆或摘要模块)。
实验结果
研究问题
- RQ1基于策略梯度的优化能否通过回溯反馈提升大型语言智能体的推理与规划能力?
- RQ2微调后的回溯模型是否在生成具有可操作性、信用分配意识的反馈方面优于冻结的 LLM,从而实现迭代任务改进?
- RQ3即插即用的回溯模块在不修改执行者 LLM 或向其反向传播梯度的情况下,能在多大程度上提升智能体性能?
- RQ4回溯反馈的结构(如反思与计划的分离)如何影响智能体性能和学习效率?
- RQ5所提出的方法能否在多样化环境和任务中实现泛化,特别是在工具使用等高维状态-动作空间的问答任务中?
主要发现
- Retroformer 在 HotPotQA 上的基于搜索的问答任务中,4 次尝试内将成功率提升 18%,显著优于基线方法。
- 微调后的回溯模型学会进行精确的信用分配,识别出智能体在思维链推理过程中因忘记目标而失败。
- 与产生重复、无用反思的冻结 LLM 不同,强化后的模型生成结构化反馈,包含明确的反思与行动计划两部分。
- 通过移除冗余或无关内容(如 'Next trial:'),强化模型避免了幻觉,输出更清晰、更具可操作性的提示。
- 该方法在基准测试中实现了 53% 的成功率(5 次尝试内),超过使用更大规模 LLM(GPT-3)的最先进方法的 50% 成功率。
- 策略梯度方法使回溯模型能够通过与环境反馈的试错,习得根因分析和结构化响应格式等涌现行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。