[논문 리뷰] AutoFlow: Automated Workflow Generation for Large Language Model Agents
AutoFlow는 강화학습을 사용하여 LLM 기반 에이전트의 자연어 워크플로우를 자동으로 생성하는 프레임워크로, 효과적이고 신뢰할 수 있는 작업 실행을 가능하게 합니다. 오픈소스 LLM을 사용할 경우 기존의 CoRE와 같은 베이스라인 대비 40퍼센트 이상의 성능 향상을 달성하며, 복잡한 작업 해결에서 뛰어난 효율성과 가독성을 입증합니다.
Recent advancements in Large Language Models (LLMs) have shown significant progress in understanding complex natural language. One important application of LLM is LLM-based AI Agent, which leverages the ability of LLM as well as external tools for complex-task solving. To make sure LLM Agents follow an effective and reliable procedure to solve the given task, manually designed workflows are usually used to guide the working mechanism of agents. However, manually designing the workflows requires considerable efforts and domain knowledge, making it difficult to develop and deploy agents on massive scales. To address these issues, we propose AutoFlow, a framework designed to automatically generate workflows for agents to solve complex tasks. AutoFlow takes natural language program as the format of agent workflow and employs a workflow optimization procedure to iteratively optimize the workflow quality. Besides, this work offers two workflow generation methods: fine-tuning-based and in-context-based methods, making the AutoFlow framework applicable to both open-source and closed-source LLMs. Experimental results show that our framework can produce robust and reliable agent workflows. We believe that the automatic generation and interpretation of workflows in natural language represent a promising paradigm for solving complex tasks, particularly with the rapid development of LLMs. The source code of this work is available at https://github.com/agiresearch/AutoFlow.
연구 동기 및 목표
- LLM 기반 에이전트의 신뢰할 수 있는 워크플로우를 수동으로 설계하기 위해 필요한 높은 인간의 노동력과 영역 전문 지식을 해결하기 위해.
- 수동 엔지니어링 없이 워크플로우 생성을 자동화하여 LLM 에이전트의 스케일러블한 배포를 가능하게 하기 위해.
- 세분화된 생성 방법(피팅 튜닝 및 인라인 학습)을 통해 오픈소스 및 클로즈드소스 LLM 모두를 지원하기 위해.
- 성능 보상(예: CLIP, BERT, ViT 점수)을 사용한 반복적 강화학습 최적화를 통해 워크플로우 품질을 향상시키기 위해.
- 수동으로 설계된 대비 작업 해결 성능을 향상시키면서도 생성된 워크플로우의 인간 가독성을 유지하기 위해.
제안 방법
- 해석 가능성과 인간 이해의 용이성을 위해 에이전트 워크플로우를 자연어 프로그램으로 표현합니다.
- 두 모델 구조를 사용: 워크플로우를 생성하는 생성기 LLM과 이를 실행 및 평가하는 고정된 해석기 LLM.
- 성능 메트릭(예: CLIP, BERT, ViT 점수)을 보상으로 사용하는 강화학습(REINFORCE)을 적용하여 30회 반복 동안 생성기 LLM을 미세조정합니다.
- 오픈소스 LLM(예: Mixtral)의 효율적인 미세조정을 위해 랭크 8의 저랭크 적응(LoRA)을 적용합니다.
- 파rameter 업데이트 없이도 넓은 호환성을 확보할 수 있도록 클로즈드소스 LLM(예: GPT-4)에 대해 인라인 학습을 지원합니다.
- 해석기의 실행 및 평가 결과 피드백을 기반으로 생성기의 최적화를 반복하여 워크플로우를 정교화합니다.
실험 결과
연구 질문
- RQ1LLM이 자연어 워크플로우를 자동으로 생성하여 LLM 에이전트에서 수동으로 설계된 워크플로우를 대체할 수 있는가?
- RQ2강화학습이 복잡한 작업 실행을 위한 LLM 생성 워크플로우 최적화에 얼마나 효과적인가?
- RQ3AutoFlow 프레임워크가 수동 설계 또는 기존의 베이스라인 워크플로우보다 더 뛰어난 성능을 달성할 수 있는가?
- RQ4다른 LLM을 생성기와 해석기로 조합할 경우(예: Mixtral + GPT-4) 상호보완적인 성능 향상이 이루어지는가?
- RQ5성능 향상을 이루는 동안 생성된 워크플로우가 인간에게 해석 가능하고 가독성이 높은 정도는 어느 정도인가?
주요 결과
- 해석기 LLM으로 Mixtral을 사용할 경우, AutoFlow는 최고의 베이스라인인 CoRE 대비 평균 성능에서 40퍼센트 이상 향상되었습니다.
- GPT-4를 해석기로 사용할 경우, AutoFlow는 CoRE 대비 5퍼센트의 성능 향상을 달성하여 일관된 우수성을 입증했습니다.
- OpenAGI 벤치마크에서 가장 높은 평균 점수는 GPT-4를 생성기로, Mixtral을 해석기로 사용한 AutoFlow가 기록했습니다.
- AutoFlow가 생성한 워크플로우는 모든 작업 유형에서 표의 최고 점수를 기록하여 다양한 작업에 대한 강력한 적합성을 입증했습니다.
- 수동 설계의 노력은 크게 감소시켰지만, 생성된 워크플로우의 높은 가독성을 유지했습니다.
- 다른 LLM 조합(예: 생성기로 Mixtral, 해석기로 GPT-4)을 사용할 경우 성능 향상이 이루어지며, 이는 상호보완적인 강점을 보여줍니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.