Skip to main content
QUICK REVIEW

[论文解读] xLAM: A Family of Large Action Models to Empower AI Agent Systems

Jianguo Zhang, Tian Lan|arXiv (Cornell University)|Sep 5, 2024
Multi-Agent Systems and Negotiation被引用 4
一句话总结

xLAM 是一系列大规模行动模型(参数量从 1B 到 8x22B 不等),通过一种可扩展、灵活的流水线训练而成,该流水线统一、增强并合成多样化的智能体数据集,以提升自主 AI 智能体任务中的泛化能力和性能。这些模型取得了当前最先进水平的结果,在伯克利工具调用排行榜上位列第一,其在工具使用和函数调用方面的表现优于 GPT-4、Claude-3 及其他领先模型。

ABSTRACT

Autonomous agents powered by large language models (LLMs) have attracted significant research interest. However, the open-source community faces many challenges in developing specialized models for agent tasks, driven by the scarcity of high-quality agent datasets and the absence of standard protocols in this area. We introduce and publicly release xLAM, a series of large action models designed for AI agent tasks. The xLAM series includes five models with both dense and mixture-of-expert architectures, ranging from 1B to 8x22B parameters, trained using a scalable, flexible pipeline that unifies, augments, and synthesizes diverse datasets to enhance AI agents' generalizability and performance across varied environments. Our experimental results demonstrate that xLAM consistently delivers exceptional performance across multiple agent ability benchmarks, notably securing the 1st position on the Berkeley Function-Calling Leaderboard, outperforming GPT-4, Claude-3, and many other models in terms of tool use. By releasing the xLAM series, we aim to advance the performance of open-source LLMs for autonomous AI agents, potentially accelerating progress and democratizing access to high-performance models for agent tasks. Models are available at https://huggingface.co/collections/Salesforce/xlam-models-65f00e2a0a63bbcd1c2dade4

研究动机与目标

  • 为解决当前在智能体任务中用于训练开源大语言模型的高质量、多样化且标准化的数据集稀缺问题。
  • 克服现有开源智能体数据集的局限性,这些数据集存在格式异构、质量低下以及多样性不足的问题。
  • 开发一种可扩展、灵活的数据流水线,统一、增强并合成多样化的智能体数据集,以提升模型的泛化能力。
  • 训练并发布一系列大型行动模型(xLAM),使其在智能体基准测试中超越现有的开源与专有模型。
  • 通过发布 xLAM 系列及其配套训练流水线,实现高性能智能体模型的普惠化访问。

提出的方法

  • 一个多阶段数据处理流水线,将来自多种环境的多样化智能体数据集统一为单一、标准化的格式。
  • 通过指令微调、提示工程和合成数据生成实现数据增强,以提升多样性并减少过拟合。
  • 采用自动化检查、错误分类和迭代反馈回路的多阶段数据质量验证系统,以清理幻觉或错误的动作。
  • 利用大语言模型生成高质量、多样化且逼真的智能体轨迹,尤其针对罕见或代表性不足的任务进行数据合成。
  • 采用监督微调(SFT)和直接偏好优化(DPO)进行模型训练,结合全参数微调与 LoRA 适配器以提升效率。
  • 迭代式评估与反馈循环:利用模型性能结果诊断数据质量问题,并指导进一步的数据清洗与增强。

实验结果

研究问题

  • RQ1如何统一并增强多样、异构且质量低下的开源智能体数据集,以提升模型在不同环境下的泛化能力?
  • RQ2合成数据生成在多大程度上能够提升小模型和大模型在智能体任务中的性能?
  • RQ3与现有方法相比,可扩展且灵活的数据流水线是否能显著提升开源大语言模型在智能体基准测试中的表现?
  • RQ4数据清洗与增强对复杂、多轮次智能体交互中模型性能的影响如何?
  • RQ5通过高质量的数据筛选,较小的模型(1B–7B 参数)是否能实现与更大模型(如 8x22B)相媲美甚至更优的性能?

主要发现

  • xLAM-8x22B 在伯克利工具调用排行榜 v2(截至 09/03/2024)中排名第一,整体准确率达到 86.00%。
  • xLAM-7b-r 整体准确率达到 80.33%,排名 14 位,表现优于 GPT-4 和 GPT-4o 等更大模型。
  • xLAM-1b-fc-r 准确率达到 75.43%,排名 32 位,超越了 Claude-3-Opus (FC) 和 GPT-3.5-Turbo 等更大模型。
  • 与原始数据相比,数据增强使 ToolBench 上性能提升 2.3%,Webshop 上提升 5.8%,ToolQuery 上提升 18.3%。
  • 数据清洗进一步使 ToolQuery 上的性能提升 23.4%,凸显了质量验证在流水线中的关键作用。
  • 模型在 live BFCL-v2 基准测试中未见过的真实世界数据上表现出良好泛化能力,表明其具备强大的鲁棒性与迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。