[论文解读] FireAct: Toward Language Agent Fine-tuning
FireAct 提出了一种新颖的框架,通过利用来自多个任务和提示方法的多样化代理轨迹,对语言模型(LMs)进行微调,以提升其作为语言代理的性能。通过使用 GPT-4 生成的 500 条 ReAct 轨迹在 HotpotQA 上微调 LLaMA2-7B,该方法在精确匹配性能上实现了 77% 的相对提升,表明微调显著增强了代理的推理能力、鲁棒性和效率,优于少样本提示方法。
Recent efforts have augmented language models (LMs) with external tools or environments, leading to the development of language agents that can reason and act. However, most of these agents rely on few-shot prompting techniques with off-the-shelf LMs. In this paper, we investigate and argue for the overlooked direction of fine-tuning LMs to obtain language agents. Using a setup of question answering (QA) with a Google search API, we explore a variety of base LMs, prompting methods, fine-tuning data, and QA tasks, and find language agents are consistently improved after fine-tuning their backbone LMs. For example, fine-tuning Llama2-7B with 500 agent trajectories generated by GPT-4 leads to a 77% HotpotQA performance increase. Furthermore, we propose FireAct, a novel approach to fine-tuning LMs with trajectories from multiple tasks and prompting methods, and show having more diverse fine-tuning data can further improve agents. Along with other findings regarding scaling effects, robustness, generalization, efficiency and cost, our work establishes comprehensive benefits of fine-tuning LMs for agents, and provides an initial set of experimental designs, insights, as well as open questions toward language agent fine-tuning.
研究动机与目标
- 探究微调语言模型用于代理推理的被忽视潜力,超越少样本提示方法。
- 评估多样化微调数据(涵盖多个任务和提示方法)对代理性能和鲁棒性的影响。
- 提供实证证据表明,经过微调的小型语言模型在代理任务中可超越使用少样本提示的大型模型(如 GPT-3.5)。
- 探索微调中的缩放效应、泛化能力以及成本效率。
- 发布代码、数据和模型,以推动未来对微调语言代理的研究。
提出的方法
- FireAct 使用 GPT-4 通过 Google 搜索 API 解决开放域问答任务,采用 ReAct 提示格式(思维、动作、观察),收集代理轨迹。
- 将轨迹统一为单一格式,并用于在多个任务和提示策略上微调基础语言模型,包括 LLaMA2-7B 和 GPT-3.5。
- 对语言模型主干网络端到端应用微调,使其能够直接生成推理轨迹和动作,无需提示。
- 该方法支持多任务和多提示数据混合,以提升泛化能力和鲁棒性。
- 实验比较了在多种基础模型、提示技术及数据规模下,少样本提示与微调推理的性能差异。
- 评估使用 HotpotQA 上的标准指标(如精确匹配 EM)以及在工具输出噪声下的鲁棒性。

实验结果
研究问题
- RQ1使用代理轨迹对语言模型进行微调是否能在代理问答任务中持续优于少样本提示?
- RQ2微调数据的多样性(涵盖不同任务和提示方法)如何影响代理的泛化能力和鲁棒性?
- RQ3经过微调后,较小的开源语言模型是否能够超越使用少样本提示的 GPT-3.5 等大型模型?
- RQ4微调数据规模和模型尺寸对代理性能和推理效率有何影响?
- RQ5多任务微调在多大程度上能够构建一个适用于多样化应用的通用代理主干模型?
主要发现
- 使用 GPT-4 生成的 500 条 ReAct 轨迹对 LLaMA2-7B 进行微调,相较于少样本提示,HotpotQA 的精确匹配性能提升了 77%。
- 使用 500 条 ReAct 轨迹对 GPT-3.5 进行微调,使 HotpotQA 的 EM 从 31.4 提升至 39.2,相对提升 25%。
- 混合使用 ReAct 和思维链(Chain-of-Thought)轨迹进一步将 EM 提升至 41.0,相比少样本提示实现 31% 的相对提升。
- 微调后的模型将推理时间减少了 4 倍,并在工具输出存在噪声的情况下表现出 64% 更高的性能。
- 较小的开源语言模型(如 LLaMA2-7B)在微调后获得了更大的相对收益,表明其在成本效益高的代理部署方面具有巨大潜力。
- 在微调过程中引入多样化任务并未降低下游任务的性能,反而可能支持更广泛的泛化能力,表明大规模多任务微调具有广阔前景。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。