[論文レビュー] AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML
本稿では、検索拡張計画と段階的検証を介して協調する専用のLLMエージェントを用いて、データ取得・前処理からモデルデプロイまでを自動化する、マルチエージェントLLMフレームワークAutoML-Agentを提案する。14のデータセットと7つのタスクにおいて平均96.2%の成功率を達成し、ベースラインを上回る成功率と効率性を実現するとともに、MCTSベースの手法と比較して探索時間を最大90%短縮した。
Automated machine learning (AutoML) accelerates AI development by automating tasks in the development pipeline, such as optimal model search and hyperparameter tuning. Existing AutoML systems often require technical expertise to set up complex tools, which is in general time-consuming and requires a large amount of human effort. Therefore, recent works have started exploiting large language models (LLM) to lessen such burden and increase the usability of AutoML frameworks via a natural language interface, allowing non-expert users to build their data-driven solutions. These methods, however, are usually designed only for a particular process in the AI development pipeline and do not efficiently use the inherent capacity of the LLMs. This paper proposes AutoML-Agent, a novel multi-agent framework tailored for full-pipeline AutoML, i.e., from data retrieval to model deployment. AutoML-Agent takes user's task descriptions, facilitates collaboration between specialized LLM agents, and delivers deployment-ready models. Unlike existing work, instead of devising a single plan, we introduce a retrieval-augmented planning strategy to enhance exploration to search for more optimal plans. We also decompose each plan into sub-tasks (e.g., data preprocessing and neural network design) each of which is solved by a specialized agent we build via prompting executing in parallel, making the search process more efficient. Moreover, we propose a multi-stage verification to verify executed results and guide the code generation LLM in implementing successful solutions. Extensive experiments on seven downstream tasks using fourteen datasets show that AutoML-Agent achieves a higher success rate in automating the full AutoML process, yielding systems with good performance throughout the diverse domains.
研究の動機と目的
- 既存のLLMベースAutoMLシステムがハイパーパramータチューニングやモデル選択といった孤立したパイプライン段階に限定されているという限界を解消し、エンド・ツー・エンドの自動化を実現すること。
- 多様で知識に基づいた計画の探索を可能にする検索拡張戦略を導入することで、エンド・ツー・エンドAutoMLの計画の複雑さを軽減すること。
- 役割別エージェント分解と段階的検証を用いることで、自律的MLパイプライン構築におけるコード生成の正確性を向上させ、幻覚現象を低減すること。
- データ、モデル、評価段階を統合したフレームワークとしての統合を実現することで、非エキスパートユーザー向けに効率的でスケーラブルかつデプロイ可能であるAutoMLを可能にすること。
- 検索拡張計画と検証を併用したマルチエージェント連携が、多様なMLタスクにおいて成功確率と計算効率を顕著に向上させることを示すこと。
提案手法
- AutoML-Agentは、専用のLLMエージェント(例:データ、モデル、検証エージェント)が並列で動作するマルチエージェントアーキテクチャを採用し、データ前処理、ニューラルアーキテクチャサーチ、ハイパーパramータチューニングなどのサブタスクを分解・解決する。
- 関連知識(例:データセット、過去のパイプラインなど)を検索することで複数の候補計画を生成する検索拡張計画戦略を導入し、最適解の探索を強化する。
- 各計画は原子的サブタスクに分解され、役割別プロンプトを用いて専用エージェントに割り当てられ、並列実行が可能となり、全体のパイプライン時間の短縮が図られる。
- 段階的検証プロセスにより中間結果が検証され、コード生成エージェントの指針が与えられ、反復フィードバックによって幻覚現象を低減し、正しさを保証する。
- エンド・ツー・エンドパイプラインの品質を評価するための包括的なスコアリングシステムを採用し、成功確率、正規化性能、包括的スコアを統合的に評価する。
- 無効な計画を早期にフィルタリングし、コストと時間の最適化を図ることで制約対応実行を可能にし、制約なし設定と比較して総実行時間を4.8%短縮、コストを18.5%削減した。
実験結果
リサーチクエスチョン
- RQ1マルチエージェントLLMフレームワークは、エキスパートレベルの設定を必要とせず、データ取得からデプロイまでを効果的に自動化できるか?
- RQ2検索拡張計画は、単一計画やヒューリスティックベースの手法と比較して、パイプラインの成功確率と多様性を向上させるか?
- RQ3役割別エージェント分解と並列実行は、エンド・ツー・エンドAutoMLの時間的・計算的コストを顕著に低減できるか?
- RQ4段階的検証は、コードの幻覚現象をどれほど低減させ、生成されたMLパイプラインの信頼性を向上させられるか?
- RQ5多様で現実世界のデータセットとタスクにおいて、AutoML-Agentは最先端のベースラインと比較して、成功確率、性能、効率性の観点で優れているか?
主な発見
- AutoML-Agentは14のデータセットと7つの下流タスクにおいて平均96.2%の成功率を達成し、DS-Agent(66.1%)や制約対応GPT-3.5(7.7%)といったベースライン手法を顕著に上回った。
- MCTSベースのSELAと比較して、平均探索時間を2037.18秒から249.91秒へ90%短縮したが、正規化性能スコアは維持または向上させた。
- 1タスクあたり5つの計画を生成した結果、画像分類とテキスト分類では100%の成功率を達成し、ノード分類では90.6%の包括的スコアを記録し、タスク全体にわたる頑健性を示した。
- 段階的検証戦略によりコードの信頼性が向上し、幻覚現象が低減され、適切な依存関係の処理が保証された。コード生成とデプロイで96.9%の成功が確認された。
- ランクイン比較では、8つのコンペティションのうち7つでAgent Kを上回り、中央ランクイン数値は88.5(Agent Kは86.5)を記録した。タスク別性能では5/8のケースで低い水準にとどまった。
- 制約対応設定では、総コストを18.5%($0.32 vs. $0.27)削減し、実行時間を4.8%(512.35s vs. 538.25s)短縮した。性能に妥協を来さずに効率性の向上が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。