[论文解读] AGILE: A Novel Reinforcement Learning Framework of LLM Agents
AGILE 是一种新颖的强化学习框架,用于大语言模型(LLM)智能体,将记忆、工具使用、专家咨询和反思整合为统一系统,通过近端策略优化(PPO)进行端到端训练以优化性能。该框架在 ProductQA 和 MedMCQA 上取得最先进结果,超越 GPT-4 和 GPT-3.5,消融实验验证了所有组件的关键作用。
We introduce a novel reinforcement learning framework of LLM agents named AGILE (AGent that Interacts and Learns from Environments) designed to perform complex conversational tasks with users, leveraging LLMs, memory, tools, and interactions with experts. The agent possesses capabilities beyond conversation, including reflection, tool usage, and expert consultation. We formulate the construction of such an LLM agent as a reinforcement learning (RL) problem, in which the LLM serves as the policy model. We fine-tune the LLM using labeled data of actions and the PPO algorithm. We focus on question answering and release a dataset for agents called ProductQA, comprising challenging questions in online shopping. Our extensive experiments on ProductQA, MedMCQA and HotPotQA show that AGILE agents based on 7B and 13B LLMs trained with PPO can outperform GPT-4 agents. Our ablation study highlights the indispensability of memory, tools, consultation, reflection, and reinforcement learning in achieving the agent's strong performance. Datasets and code are available at https://github.com/bytarnish/AGILE.
研究动机与目标
- 将多种 LLM 智能体能力——推理、规划、反思、工具使用、记忆和专家咨询——统一为一个可端到端训练的框架。
- 解决当前缺乏全面评估多种智能体组件在复杂问答任务中集成效果的基准问题。
- 构建一个新基准 ProductQA,包含 88,229 个真实世界的产品查询,覆盖 26 个类别,用于评估智能体在多样化、真实场景中的表现。
- 证明强化学习(特别是 PPO 微调)可显著提升智能体性能,超越仅使用监督微调的效果。
- 验证专家咨询作为提升复杂、分布外任务中准确性和适应性的机制的必要性与有效性。
提出的方法
- AGILE 框架将智能体结构化为包含四个核心模块的系统:大语言模型(策略模型)、记忆、工具和执行器,其中执行器负责协调动作与上下文更新。
- 大语言模型生成动作(token),由执行器解释并执行,执行器负责管理记忆检索、工具调用和专家咨询。
- 专家咨询被建模为一种主动机制:当智能体不确定时,主动寻求人类反馈,随后对反馈进行反思并存储以供未来使用。
- 智能体通过两阶段训练过程进行优化:第一阶段为在标注动作序列上进行监督微调(SFT);第二阶段使用近端策略优化(PPO)进行策略优化,以最大化任务奖励。
- 该框架支持在单一强化学习目标下,对推理、规划、反思和咨询能力进行端到端训练。
- 构建了一个新基准 ProductQA,包含真实的 Amazon 客户查询,涵盖事实性问题、推理问题和推荐问题,训练集与测试集互不重叠,用于评估零样本泛化能力。
实验结果
研究问题
- RQ1统一的 LLM 智能体框架能否有效整合记忆、工具使用、反思与专家咨询,形成一个可端到端训练的单一系统?
- RQ2与仅使用监督微调相比,使用 PPO 的强化学习是否能显著提升复杂问答任务中的智能体性能?
- RQ3记忆、工具、专家咨询和反思等各个组件对整体智能体性能有多关键?
- RQ4所提出的智能体框架能否泛化到新的产品类别,并在零样本设置下超越 GPT-4 等强基线模型?
- RQ5专家咨询在处理复杂、模糊或分布外查询时,能在多大程度上提升准确性和适应性?
主要发现
- 经过 PPO 微调的 AGILE 智能体(agile-vic13b-ppo)在 ProductQA 基准上相较 GPT-4 实现了 9.2% 的相对性能提升。
- 同一智能体在总分上相较 GPT-3.5 实现了 90.8% 的相对提升,证明了 PPO 训练策略的有效性。
- 消融实验表明,移除记忆或工具分别使专家咨询请求增加 17.4% 和 25.9%,表明二者在减少对人工输入依赖方面具有关键作用。
- 禁用专家咨询功能导致准确率下降 10.7%,证实其在处理复杂查询中的核心作用。
- 在 MedMCQA 上,agile-mek7b-ppo 智能体达到 85.2% 的准确率,超越 GPT-4-MedPrompt 的 SOTA 结果(79.1%)和基线 Meerkat-7b 的 53.4%。
- 与 SFT 基线相比,PPO 微调阶段使性能提升了 2.3% 的相对增益,确认了强化学习在策略优化中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。