[논문 리뷰] xLAM: A Family of Large Action Models to Empower AI Agent Systems
xLAM은 다양한 에이전트 데이터셋을 통합, 증강 및 합성하여 자율 AI 에이전트 작업에서 일반화 능력과 성능을 향상시키는 가용성 있고 유연한 파이프라인을 통해 훈련된 대규모 동작 모델(1B에서 8x22B 파라미터)의 가족입니다. 이 모델들은 최신 기준 성능을 달성하여 버클리 기능호출 랭킹에서 1위를 차지하며, GPT-4, Claude-3 및 기타 선도적 모델들을 능가하는 도구 사용 및 기능 호출 성능을 보입니다.
Autonomous agents powered by large language models (LLMs) have attracted significant research interest. However, the open-source community faces many challenges in developing specialized models for agent tasks, driven by the scarcity of high-quality agent datasets and the absence of standard protocols in this area. We introduce and publicly release xLAM, a series of large action models designed for AI agent tasks. The xLAM series includes five models with both dense and mixture-of-expert architectures, ranging from 1B to 8x22B parameters, trained using a scalable, flexible pipeline that unifies, augments, and synthesizes diverse datasets to enhance AI agents' generalizability and performance across varied environments. Our experimental results demonstrate that xLAM consistently delivers exceptional performance across multiple agent ability benchmarks, notably securing the 1st position on the Berkeley Function-Calling Leaderboard, outperforming GPT-4, Claude-3, and many other models in terms of tool use. By releasing the xLAM series, we aim to advance the performance of open-source LLMs for autonomous AI agents, potentially accelerating progress and democratizing access to high-performance models for agent tasks. Models are available at https://huggingface.co/collections/Salesforce/xlam-models-65f00e2a0a63bbcd1c2dade4
연구 동기 및 목표
- 에이전트 작업에서 오픈소스 LLM을 훈련하기 위한 고품질, 다양성, 표준화된 데이터셋의 부족 문제를 해결하기 위해.
- 기존 오픈소스 에이전트 데이터셋이 형식 이질성, 낮은 품질, 다양성 부족 등의 한계를 겪고 있다는 점을 해결하기 위해.
- 다양한 에이전트 데이터셋을 통합, 증강 및 합성하여 모델의 일반화 능력을 향상시키는 확장성 있고 민첩한 데이터 파이프라인을 개발하기 위해.
- 기존 오픈소스 및 전용 모델을 능가하는 에이전트 벤치마크 성능을 보이는 대규모 동작 모델(xLAM)을 훈련하고 공개하기 위해.
- xLAM 시리즈와 관련 훈련 파이프라인을 공개하여 고성능 에이전트 모델에 대한 접근성을 민주화하기 위해.
제안 방법
- 다양한 환경에서 오는 이질적인 에이전트 데이터셋을 하나의 표준 형식으로 통합하는 다단계 데이터 처리 파이프라인.
- 지시 테이닝, 프롬프트 엔지니어링 및 합성 데이터 생성을 통한 데이터 증강으로 다양성을 증가시키고 과적합을 줄이기.
- 자동화된 검사, 오류 분류 및 반복 피드백 루프를 활용한 다단계 데이터 품질 검증 시스템을 통해 잘못된 동작이나 환각된 행동을 정리하기.
- 대규모 언어 모델을 사용해 희귀하거나 부족하게 표현된 작업에 대해 고품질, 다양성 있고 현실적인 에이전트 트레이젝터리를 합성하는 방법.
- 효율성을 위해 전체 미세조정과 LoRA 어댑터를 모두 활용한 지도 미세조정(SFT) 및 직접 선호도 최적화(DPO)를 통한 모델 훈련.
- 반복적인 평가 및 피드백 루프: 모델 성능 결과를 바탕으로 데이터 품질 문제를 진단하고 더 나은 데이터 정제 및 증강을 유도하기.
실험 결과
연구 질문
- RQ1다양하고 이질적이며 품질이 낮은 오픈소스 에이전트 데이터셋은 어떻게 통합하고 향상시켜 다양한 환경에서의 모델 일반화 능력을 향상시킬 수 있는가?
- RQ2합성 데이터 생성은 소형 및 대형 언어 모델의 에이전트 작업 성능을 얼마나 향상시킬 수 있는가?
- RQ3확장성 있고 민감한 데이터 파이프라인이 기존 접근 방식에 비해 오픈소스 LLM의 에이전트 벤치마크 성능을 크게 향상시킬 수 있는가?
- RQ4데이터 정제 및 증강은 복잡한 다단계 에이전트 상호작용에서 모델 성능에 어떤 영향을 미치는가?
- RQ5고품질 데이터 쿠레이션을 통해 소형 모델(1B–7B 파라미터)이 훨씬 큰 모델(예: 8x22B)과 경쟁할 수 있는 성능을 달성할 수 있는가?
주요 결과
- xLAM-8x22B는 2024년 9월 3일 기준 버클리 기능호출 랭킹 v2에서 전체 정확도 86.00%로 1위를 기록하며 최고의 순위를 확보했다.
- xLAM-7b-r는 전체 정확도 80.33%를 기록해 14위를 차지했으며, GPT-4 및 GPT-4o와 같은 더 큰 모델들을 능가했다.
- xLAM-1b-fc-r는 정확도 75.43%를 기록해 32위를 차지했고, Claude-3-Opus (FC) 및 GPT-3.5-Turbo와 같은 더 큰 모델들을 뛰어넘었다.
- 데이터 증강은 ToolBench에서 2.3%, Webshop에서 5.8%, ToolQuery에서 18.3% 향상시켜 원시 데이터 대비 성능 향상을 이뤘다.
- 데이터 정제는 ToolQuery에서 성능을 23.4% 더 향상시켜 파이프라인 내 품질 검증의 핵심적인 역할을 입증했다.
- 모델들은 라이브 BFCL-v2 벤치마크에서의 실제 세계의 새로운 데이터에 대해 잘 일반화되어 있어 강력한 내재성과 전이 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.