[논문 리뷰] FireAct: Toward Language Agent Fine-tuning
FireAct는 다양한 작업과 프롬프팅 방법으로부터 유도된 다양한 에이전트 트레이ector리(궤적)를 활용하여 언어 모델(LMs)을 피팅 튜닝하는 새로운 프레임워크를 제안한다. 이는 언어 에이전트로서의 성능 향상에 기여한다. GPT-4가 생성한 500개의 ReAct 트레이젝터리를 사용해 LLaMA2-7B를 피팅 튜닝함으로써 HotpotQA에서 정확도 일치(EM) 성능이 77% 향상되었으며, 이는 피팅 튜닝이 소수 샘플 프롬프팅에 비해 에이전트 추론 능력, 내성적 안정성, 효율성을 크게 향상시킨다는 것을 보여준다.
Recent efforts have augmented language models (LMs) with external tools or environments, leading to the development of language agents that can reason and act. However, most of these agents rely on few-shot prompting techniques with off-the-shelf LMs. In this paper, we investigate and argue for the overlooked direction of fine-tuning LMs to obtain language agents. Using a setup of question answering (QA) with a Google search API, we explore a variety of base LMs, prompting methods, fine-tuning data, and QA tasks, and find language agents are consistently improved after fine-tuning their backbone LMs. For example, fine-tuning Llama2-7B with 500 agent trajectories generated by GPT-4 leads to a 77% HotpotQA performance increase. Furthermore, we propose FireAct, a novel approach to fine-tuning LMs with trajectories from multiple tasks and prompting methods, and show having more diverse fine-tuning data can further improve agents. Along with other findings regarding scaling effects, robustness, generalization, efficiency and cost, our work establishes comprehensive benefits of fine-tuning LMs for agents, and provides an initial set of experimental designs, insights, as well as open questions toward language agent fine-tuning.
연구 동기 및 목표
- 소수 샘플 프롬프팅을 넘어서 언어 모델의 에이전트 추론 잠재력을 간과하고 있는지 조사하기 위해.
- 다양한 작업과 프롬프팅 방법에서 유도된 피팅 튜닝 데이터의 영향이 에이전트 성능과 내성적 안정성에 미치는 영향을 평가하기 위해.
- 피팅 튜닝된 소형 언어 모델이 소수 샘플 프롬프팅된 대형 모델보다 에이전트 작업에서 뛰어난 성능을 보일 수 있음을 경험적으로 입증하기 위해.
- 언어 에이전트 피팅 튜닝에서의 스케일링 효과, 일반화 능력, 비용 효율성에 대해 탐구하기 위해.
- 미래의 연구를 촉진하기 위해 코드, 데이터, 모델을 공개하기 위해.
제안 방법
- FireAct는 GPT-4를 사용해 Google 검색 API를 활용해 개방형 도메인 질의 응답 작업을 해결하는 데에 ReAct 프롬프팅 형식(사고, 행동, 관찰)을 적용하여 에이전트 트레이젝터리를 수집한다.
- 트레이젝터리는 단일 형식으로 통합되어 여러 작업과 프롬프팅 전략에서 기초 언어 모델(LaMA2-7B, GPT-3.5 등)을 피팅 튜닝하는 데 사용된다.
- 피팅 튜닝은 언어 모델의 백본에 종단 간(end-to-end)으로 적용되어, 프롬프팅 없이도 직접 추론 트레이스와 행동을 생성할 수 있도록 한다.
- 다양한 작업과 프롬프팅 전략의 데이터 혼합을 지원함으로써 일반화 능력과 내성적 안정성을 향상시킨다.
- 실험은 다양한 기초 모델, 프롬프팅 기법, 데이터 규모에서 소수 샘플 프롬프팅 대비 피팅 튜닝 추론의 성능을 비교한다.
- 평가에는 HotpotQA에서 정확도 일치(EM)와 노이즈가 있는 도구 출력 상황에서의 내성적 안정성과 같은 표준 지표를 사용한다.

실험 결과
연구 질문
- RQ1에이전트 트레이젝터리를 사용해 언어 모델을 피팅 튜닝하면 소수 샘플 프롬프팅 대비 에이전트 QA 작업에서 일관된 성능 향상이 이루어지는가?
- RQ2다양한 작업과 프롬프팅 방법에서 유도된 피팅 튜닝 데이터의 다양성이 에이전트의 일반화 능력과 내성적 안정성에 어떤 영향을 미치는가?
- RQ3피팅 튜닝을 거친 소형 오픈소스 언어 모델이 소수 샘플 프롬프팅된 대형 모델(GPT-3.5 등)을 능가할 수 있는가?
- RQ4피팅 튜닝 데이터 규모와 모델 크기가 에이전트 성능과 추론 효율성에 어떤 영향을 미치는가?
- RQ5다양한 응용 분야에 걸쳐 유일한 유능한 에이전트 백본을 만들기 위해 다중 작업 피팅 튜닝이 얼마나 효과적인가?
주요 결과
- GPT-4가 생성한 500개의 ReAct 트레이젝터리를 사용해 LLaMA2-7B를 피팅 튜닝함으로써 HotpotQA에서 정확도 일치(EM) 성능이 소수 샘플 프롬프팅 대비 77% 향상되었다.
- GPT-3.5를 500개의 ReAct 트레이젝터리로 피팅 튜닝함으로써 HotpotQA의 EM 점수가 31.4에서 39.2로 상승하여 상대적 향상률이 25%에 달했다.
- ReAct와 Chain-of-Thought 트레이젝터리를 혼합하여 피팅 튜닝한 결과 EM 점수가 41.0으로 상승하여 소수 샘플 프롬프팅 대비 31%의 상대적 향상률을 기록했다.
- 피팅 튜닝된 모델은 추론 시간을 4배로 단축했으며, 노이즈가 있는 도구 출력 상황에서도 성능이 64% 높게 나타났다.
- 소형 오픈소스 언어 모델(LaMA2-7B 등)은 피팅 튜닝을 통해 더 큰 상대적 성능 향상을 보였으며, 이는 비용 효율적인 에이전트 구현 가능성을 시사한다.
- 피팅 튜닝 과정에서 다양한 작업을 포함시켜도 후속 작업에서 성능 저하가 발생하지 않았으며, 더 넓은 일반화 능력을 지원할 수 있음을 시사하며, 대규모 다중 작업 피팅 튜닝의 잠재력이 높다고 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.