Skip to main content
QUICK REVIEW

[논문 리뷰] AFlow: Automating Agentic Workflow Generation

Jiayi Zhang, Jianhai Xiang|arXiv (Cornell University)|2024. 10. 14.
Scientific Computing and Data Management인용 수 6
한 줄 요약

AFLOW는 코드로 표현되고 LLM을 호출하는 워크플로우에 대해 몬테카를로 트리 탐색을 사용하여 자동으로 에이전틱한 워크플로우를 발견하고, 수작업 및 자동 baselines를 6개 벤치마크에서 능가하며 더 작은 모델이 비용-성능 측면에서 강력한 성능을 달성하도록 합니다. 이는 최첨단 baselines 대비 평균 5.7%의 개선을 달성하고 상당한 비용 효율성을 제공합니다.

ABSTRACT

Large language models (LLMs) have demonstrated remarkable potential in solving complex tasks across diverse domains, typically by employing agentic workflows that follow detailed instructions and operational sequences. However, constructing these workflows requires significant human effort, limiting scalability and generalizability. Recent research has sought to automate the generation and optimization of these workflows, but existing methods still rely on initial manual setup and fall short of achieving fully automated and effective workflow generation. To address this challenge, we reformulate workflow optimization as a search problem over code-represented workflows, where LLM-invoking nodes are connected by edges. We introduce AFlow, an automated framework that efficiently explores this space using Monte Carlo Tree Search, iteratively refining workflows through code modification, tree-structured experience, and execution feedback. Empirical evaluations across six benchmark datasets demonstrate AFlow's efficacy, yielding a 5.7% average improvement over state-of-the-art baselines. Furthermore, AFlow enables smaller models to outperform GPT-4o on specific tasks at 4.55% of its inference cost in dollars. The code is available at https://github.com/FoundationAgents/AFlow.

연구 동기 및 목표

  • 에이전틱 워크플로우의 수작업 설계 노력을 줄이기 위한 확장 가능한 자동화 동기 부여.
  • 워크플로우 최적화를 코드로 표현된 LLM 호출 그래프를 탐색하는 문제로 공식화하기.
  • 공간을 효율적으로 탐색하기 위한 연산자들을 갖춘 MCTS 기반 프레임워크 AFLOW를 개발하기.
  • 다수의 벤치마크와 비용-효율성 함의에 걸쳐 AFLOW의 효과를 입증하기.

제안 방법

  • 워크플로우를 노드(LLM 호출)로 표현하고 코드 기반 간선으로 연결합니다.
  • 소프트 혼합 확률 노드 선택과 LLM 주도 확장을 포함한 Monte Carlo Tree Search를 사용합니다.
  • 재사용 가능한 워크플로우 패턴을 구축하기 위한 연산자(예: Generate, Review & Revise, Ensemble)들을 도입합니다.
  • 검색 공간의 초점을 간선과 프롬프트에 두고 핵심 매개변수(모델, 온도, 포맷)를 고정합니다.
  • 생성된 워크플로우를 실행 피드백으로 평가하고 경험을 역전파하여 탐색을 안내합니다.
  • AFLOW가 평균적으로 baselines보다 성능을 5.7% 향상시키고 더 작은 모델이 더 큰 모델을 더 낮은 비용으로 이길 수 있음을 입증합니다.

실험 결과

연구 질문

  • RQ1AFLOW가 수작업 개입 없이도 다양한 도메인에서 고성능의 에이전틱 워크플로우를 자동으로 발견할 수 있는가?
  • RQ2AFLOW의 MCTS 기반 탐색은 성능과 효율성 면에서 기존 자동 워크플로우 최적화 방법과 비교해 어떤 차이가 있는가?
  • RQ3다른 실행 LLM과 함께 사용할 때 AFLOW의 비용-성능 트레이드오프는 어떤가?
  • RQ4발견된 워크플로우가 서로 다른 언어 모델 간에 어느 정도 이식 가능한가?
  • RQ5연산자의 도입이 탐색 효율성과 최종 워크플로우 품질에 미치는 영향은 무엇인가?

주요 결과

  • AFLOW는 여섯 벤치마크에서 최첨단 baselines에 대해 평균 5.7%의 개선을 달성합니다.
  • AFLOW는 기존의 자동화 접근법을 19.5% 초과합니다.
  • 평균적으로 AFLOW 워크플로우는 QA, 코드, 수학 도메인에서 80.3%의 성능을 달성합니다.
  • AFLOW로 발견된 워크플로우는 더 작은 LLM이 큰 모델을 능가하도록 낮은 비용으로 가능하게 합니다(파레토 프런트 결과).
  • AFLOW는 서로 다른 실행자 간에 발견된 워크플로우의 모델 비의존적 이식성을 보여줍니다.
  • Ablaion은 연산자가 탐색 효율을 개선한다는 것을 보여주며, 미리 정의된 연산자가 없어도 AFLOW가 잘 작동할 수 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.