Skip to main content
QUICK REVIEW

[논문 리뷰] AGILE: A Novel Reinforcement Learning Framework of LLM Agents

Peiyuan Feng, Yichen He|arXiv (Cornell University)|2024. 05. 23.
Multi-Agent Systems and Negotiation인용 수 4
한 줄 요약

AGILE는 메모리, 도구, 전문가 상담 및 반성 기능을 통합한 유일한 시스템으로, 종합적인 성능을 최적화하기 위해 PPO를 통해 훈련되는 새로운 강화학습 프레임워크이다. ProductQA와 MedMCQA에서 최신 기술 수준을 달성하며, GPT-4와 GPT-3.5를 능가한다. 제거 실험을 통해 모든 구성 요소의 핵심적 역할을 확인하였다.

ABSTRACT

We introduce a novel reinforcement learning framework of LLM agents named AGILE (AGent that Interacts and Learns from Environments) designed to perform complex conversational tasks with users, leveraging LLMs, memory, tools, and interactions with experts. The agent possesses capabilities beyond conversation, including reflection, tool usage, and expert consultation. We formulate the construction of such an LLM agent as a reinforcement learning (RL) problem, in which the LLM serves as the policy model. We fine-tune the LLM using labeled data of actions and the PPO algorithm. We focus on question answering and release a dataset for agents called ProductQA, comprising challenging questions in online shopping. Our extensive experiments on ProductQA, MedMCQA and HotPotQA show that AGILE agents based on 7B and 13B LLMs trained with PPO can outperform GPT-4 agents. Our ablation study highlights the indispensability of memory, tools, consultation, reflection, and reinforcement learning in achieving the agent's strong performance. Datasets and code are available at https://github.com/bytarnish/AGILE.

연구 동기 및 목표

  • 메모리, 도구 사용, 반성, 전문가 상담 등의 다양한 LLM 에이전트 기능을 하나의 종단간 훈련 가능한 프레임워크로 통합하는 것.
  • 복잡한 질문-답변 작업에서 다수의 에이전트 구성 요소를 종합적으로 평가할 수 있는 벤치마크 부족 문제를 해결하는 것.
  • 실제 상황을 반영한 26개 카테고리에 걸친 88,229개의 실질적 제품 질의를 포함한 새로운 벤치마크인 ProductQA를 개발하여 다양한 현실적인 상황에서의 에이전트 성능 평가를 수행하는 것.
  • 강화학습, 특히 PPO 미세조정이 단순 지도 학습 미세조정보다 에이전트 성능을 크게 향상시킨다는 것을 입증하는 것.
  • 복잡하고 분포를 벗어난 작업에서 정확도와 적응력을 향상시키는 데 전문가 상담 기능이 필수적이고 효과적인지 검증하는 것.

제안 방법

  • AGILE 프레임워크는 LLM(정책 모델), 메모리, 도구, 실행기로 구성된 네 핵심 모듈을 갖춘 시스템으로 구성된다. 실행기는 행동 조율 및 컨텍스트 업데이트를 담당한다.
  • LLM은 토큰 형태의 행동을 생성하며, 실행기는 이를 해석하고 실행한다. 실행기는 메모리 검색, 도구 호출, 전문가 상담을 모두 관리한다.
  • 전문가 상담은 수동적 기능이 아닌 능동적 메커니즘으로, 에이전트가 불확실할 경우 인간 피드백을 구하고, 피드백을 반성하여 향후 사용을 위해 저장한다.
  • 에이전트는 이중 단계 훈련 프로세스를 통해 훈련된다. 첫 번째 단계는 레이블이 부여된 행동 시퀀스에 대한 지도 미세조정(SFT)이며, 두 번째 단계는 작업 보상을 최대화하기 위해 Proximal Policy Optimization(PPO)를 사용한 정책 최적화이다.
  • 이 프레임워크는 종단간 강화학습 목표 내에서 추론, 계획 수립, 반성, 상담 능력의 통합적 훈련을 지원한다.
  • 실제 아마존 고객의 질의를 기반으로 한 새로운 벤치마크인 ProductQA가 구축되었으며, 사실 기반 질문, 추론 질문, 추천 질문을 포함하고 있다. 훈련 및 테스트 세트는 서로 분리되어 있어 제로샷 일반화 능력을 평가할 수 있다.

실험 결과

연구 질문

  • RQ1통합된 LLM 에이전트 프레임워크는 메모리, 도구 사용, 반성, 전문가 상담을 하나의 종단간 훈련 가능한 시스템 내에서 효과적으로 통합할 수 있는가?
  • RQ2PPO를 활용한 강화학습은 단순 지도 미세조정에 비해 복잡한 질문-답변 작업에서 에이전트 성능을 크게 향상시키는가?
  • RQ3메모리, 도구, 전문가 상담, 반성 등의 개별 구성 요소가 전체 에이전트 성능에 얼마나 중요한가?
  • RQ4제안된 에이전트 프레임워크는 새로운 제품 카테고리로 일반화될 수 있으며, GPT-4와 같은 강력한 베이스라인을 제로샷 설정에서 능가할 수 있는가?
  • RQ5전문가 상담은 복잡하고 모호하거나 분포를 벗어난 질의를 처리할 때 정확도와 적응력을 얼마나 향상시키는가?

주요 결과

  • PPO로 미세조정된 AGILE 에이전트(agile-vic13b-ppo)는 ProductQA 벤치마크에서 GPT-4보다 총점 기준 9.2%의 상대적 향상률을 기록하였다.
  • 동일한 에이전트는 총점 기준 GPT-3.5보다 90.8%의 상대적 향상률을 기록하여 PPO 훈련 방식의 효과성을 입증하였다.
  • 제거 실험 결과, 메모리나 도구를 제거할 경우 전문가 상담 요청 횟수가 각각 17.4%, 25.9% 증가하여, 이들이 인간 입력 의존도를 낮추는 데 기여한다는 점을 확인하였다.
  • 전문가 상담 기능을 비활성화했을 경우 정확도가 10.7% 감소하여, 복잡한 질의 처리에서 이 기능의 핵심적 역할을 확인하였다.
  • MedMCQA에서 agile-mek7b-ppo 에이전트는 85.2%의 정확도를 기록하여, GPT-4-MedPrompt의 최신 기술 수준(SOTA)인 79.1%를 초월하였고, 기본 Meerkat-7b의 53.4%보다도 높았다.
  • PPO 미세조정 단계는 SFT 베이스라인 대비 성능을 2.3% 상대적으로 향상시켜, 정책 최적화에서 강화학습의 가치를 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.