Skip to main content
QUICK REVIEW

[论文解读] ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agent

Renat Aksitov, Sobhan Miryoosefi|arXiv (Cornell University)|Dec 15, 2023
Topic Modeling被引用 4
一句话总结

本文提出一种自增强的、类似ReAct的大型语言模型(LLM)智能体,用于多步推理,通过结合AI反馈与类似ReST的迭代微调过程实现。利用大模型生成的合成轨迹,该方法可在仅两次训练迭代后将性能接近教师模型的模型蒸馏至小模型,参数量减少100倍,同时保持高准确率。

ABSTRACT

Answering complex natural language questions often necessitates multi-step reasoning and integrating external information. Several systems have combined knowledge retrieval with a large language model (LLM) to answer such questions. These systems, however, suffer from various failure cases, and we cannot directly train them end-to-end to fix such failures, as interaction with external knowledge is non-differentiable. To address these deficiencies, we define a ReAct-style LLM agent with the ability to reason and act upon external knowledge. We further refine the agent through a ReST-like method that iteratively trains on previous trajectories, employing growing-batch reinforcement learning with AI feedback for continuous self-improvement and self-distillation. Starting from a prompted large model and after just two iterations of the algorithm, we can produce a fine-tuned small model that achieves comparable performance on challenging compositional question-answering benchmarks with two orders of magnitude fewer parameters.

研究动机与目标

  • 解决在不依赖昂贵人工标注轨迹的情况下提升多步推理 LLM 智能体的挑战。
  • 通过迭代式合成数据生成与 AI 反馈实现智能体的持续自增强,避免端到端可微训练。
  • 展示将高性能大模型有效蒸馏为小模型,同时在复杂、组合式问答任务上保持性能的可行性。
  • 建立代理评估框架,使用 Bamboogle 与 BamTwoogle 数据集实现对长篇、有依据答案的自动评估。
  • 探究自我批判与迭代优化是否能提升基于过程、工具增强的 LLM 智能体的鲁棒性与推理质量。

提出的方法

  • 智能体遵循类似 ReAct 的工作流,将思维链推理与搜索工具调用及观察结果交错执行,以回答复杂问题。
  • 通过自增强循环生成合成轨迹:在‘生长’阶段,当前策略采样完整的推理轨迹;在‘改进’阶段,利用基于 LLM 的奖励反馈对轨迹进行过滤与排序。
  • 该方法采用基于 AI 反馈的渐增批量强化学习,策略在逐步扩大的、源自先前智能体行为的合成数据集上进行迭代微调。
  • 将自我批判步骤整合进智能体的推理流程中,以验证答案的相关性与在检索片段中的依据性,从而提升最终输出质量。
  • 最终蒸馏模型在自增强过程中生成的合成数据上进行训练,尽管参数量仅为原始大模型的百分之一,性能仍可接近教师模型。
  • 评估依赖于使用 Bamboogle 与 BamTwoogle 数据集的自动化指标,每道问题运行多次以考虑随机性并确保结果稳健。

实验结果

研究问题

  • RQ1能否仅通过 AI 反馈与合成数据,有效提升类似 ReAct 的 LLM 智能体?
  • RQ2从大模型推理轨迹生成的合成数据,在多大程度上可实现向小模型的蒸馏并达到可比性能?
  • RQ3自我批判是否能提升多步智能体的推理质量?该效果在不同模型规模下是否一致?
  • RQ4需要多少轮自增强迭代才能实现显著的性能提升?是否存在性能饱和点?
  • RQ5类似 ReST 的自增强框架能否扩展至多工具或未见过的工具场景?需要哪些修改?

主要发现

  • 仅经过两轮自增强循环,微调后的小模型在 Bamboogle 基准测试中达到与原始大模型相当的性能,10次运行的平均准确率为 78.5%,标准差为 2.1%。
  • 尽管参数量比教师模型少两个数量级,蒸馏后的小模型性能仍与教师模型相当,证明了从合成轨迹中有效蒸馏知识的能力。
  • 自我批判步骤带来微小但积极的性能提升,且在更大模型中效果更明显,且独立于自增强过程。
  • 该方法可实现对智能体轨迹的可靠自动评估,使用 PaLM 2-L 进行打分,其结果与人工评分者高度一致,支持稳健的超参数分析。
  • ReST 类似的迭代训练过程显著提升了智能体性能,且完全不依赖人工标注数据,仅依靠 AI 反馈与合成数据生成。
  • 该方法在多工具环境中有扩展潜力,但未来工作需验证其是否可泛化至未见过的工具,以及是否需要额外的架构调整。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。