Skip to main content
QUICK REVIEW

[論文レビュー] xLAM: A Family of Large Action Models to Empower AI Agent Systems

Jianguo Zhang, Tian Lan|arXiv (Cornell University)|Sep 5, 2024
Multi-Agent Systems and Negotiation被引用数 4
ひとこと要約

xLAMは、多様なエージェントデータセットを統合・拡張・合成することで、自律的AIエージェントタスクにおける汎化性能とパフォーマンスを向上させるスケーラブルで柔軟なパイプラインを用いて訓練された、1B〜8x22Bパラメータの大型アクションモデルのファミリです。これらのモデルは最先端の結果を達成し、バークレー関数呼び出しリーダーボードで1位を獲得し、ツール使用および関数呼び出しにおいてGPT-4、Claude-3、その他の主要モデルを上回っています。

ABSTRACT

Autonomous agents powered by large language models (LLMs) have attracted significant research interest. However, the open-source community faces many challenges in developing specialized models for agent tasks, driven by the scarcity of high-quality agent datasets and the absence of standard protocols in this area. We introduce and publicly release xLAM, a series of large action models designed for AI agent tasks. The xLAM series includes five models with both dense and mixture-of-expert architectures, ranging from 1B to 8x22B parameters, trained using a scalable, flexible pipeline that unifies, augments, and synthesizes diverse datasets to enhance AI agents' generalizability and performance across varied environments. Our experimental results demonstrate that xLAM consistently delivers exceptional performance across multiple agent ability benchmarks, notably securing the 1st position on the Berkeley Function-Calling Leaderboard, outperforming GPT-4, Claude-3, and many other models in terms of tool use. By releasing the xLAM series, we aim to advance the performance of open-source LLMs for autonomous AI agents, potentially accelerating progress and democratizing access to high-performance models for agent tasks. Models are available at https://huggingface.co/collections/Salesforce/xlam-models-65f00e2a0a63bbcd1c2dade4

研究の動機と目的

  • エージェントタスクにおけるオープンソース大規模言語モデル(LLM)の訓練に向けた、高品質で多様かつ標準化されたデータセットの不足を解消すること。
  • フォーマットの多様性、低品質、多様性の欠如といった既存のオープンソースエージェントデータセットの限界を克服すること。
  • 多様なエージェントデータセットを統合・拡張・合成するスケーラブルで柔軟なデータパイプラインを開発し、モデルの汎化性能を向上させること。
  • エージェントベンチマークにおいて、既存のオープンソースおよび特許モデルを上回る性能を発揮する大規模アクションモデル(xLAM)を訓練・リリースすること。
  • xLAMシリーズおよび関連するトレーニングパイプラインをリリースすることで、高性能なエージェントモデルへのアクセスを民主化すること。

提案手法

  • 複数の環境にまたがる多様なエージェントデータセットを、1つの標準化されたフォーマットに統合するマルチステージのデータ処理パイプライン。
  • インstructチューニング、プロンプト工学、および合成データ生成によるデータ拡張により、多様性を向上させ、過学習を低減すること。
  • 自動チェック、エラーの分類、反復的なフィードバックループを用いたマルチステージのデータ品質確認システムにより、誤った行動や幻覚を除去すること。
  • 大規模言語モデルを用いたデータ合成により、希少または未表現なタスクに特に適した高品質で多様かつ現実的なエージェントの軌跡を生成すること。
  • 効率性を高めるために、フルファインチューニングおよびLoRAアダプタを併用した、教師強化学習(SFT)および直接的好み最適化(DPO)を用いたモデル訓練。
  • 反復的な評価とフィードバックループ:モデルのパフォーマンス結果を活用し、データ品質の問題を診断し、さらなるデータクリーニングと拡張を指導致す。

実験結果

リサーチクエスチョン

  • RQ1多様で異種的かつ低品質なオープンソースエージェントデータセットを、どのように統合・強化することで、複数の環境におけるモデルの汎化性能を向上させられるか?
  • RQ2合成データ生成は、エージェントタスクにおける小規模および大規模言語モデルのパフォーマンスをどの程度向上させられるか?
  • RQ3スケーラブルで柔軟なデータパイプラインは、従来のアプローチと比較して、オープンソースLLMのエージェントベンチマークにおけるパフォーマンスを顕著に向上させられるか?
  • RQ4データクリーニングと拡張は、複雑で複数ターンにわたるエージェント相互作用におけるモデルパフォーマンスにどのような影響を与えるか?
  • RQ5高品質なデータキュレーションにより、小規模モデル(1B〜7Bパラメータ)は、非常に大きなモデル(例:8x22B)と同等のパフォーマンスを達成できるか?

主な発見

  • xLAM-8x22Bは、2024年9月3日をカットオフとしてのバークレー関数呼び出しリーダーボードv2で最高位を獲得し、全体の正確度86.00%を達成した。
  • xLAM-7b-rは全体の正確度80.33%を達成し、14位にランクされ、GPT-4やGPT-4oよりも優れたパフォーマンスを示した。
  • xLAM-1b-fc-rは75.43%の正確度を達成し、32位にランクされ、Claude-3-Opus(FC)やGPT-3.5-Turboよりも優れたパフォーマンスを示した。
  • データ拡張により、ToolBenchでは2.3%、Webshopでは5.8%、ToolQueryでは18.3%のパフォーマンス向上が見られた(生データと比較)。
  • データクリーニングにより、ToolQueryではさらに23.4%のパフォーマンス向上が達成され、品質確認プロセスがパイプラインにおいて極めて重要な役割を果たしていることが示された。
  • ライブのBFCL-v2ベンチマークから得られた未観測の実世界データに対しても、モデルは良好に一般化しており、強力なロバストネスと転送可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。