[논문 리뷰] WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic Exploration
WebPilot는 고수준 계획과 MCTS 기반 국소 실행을 조합한 이중 최적화 전략을 통해 LLM 기반 웹 에이전트의 성능을 향상시키는 다중 에이전트 시스템을 소개한다. 이는 복잡하고 동적인 웹 환경에서 강력하고 유연한 탐색을 가능하게 하며, GPT-4를 사용해 WebArena에서 이전의 트리 탐색 방법 대비 성공률을 93% 향상시킨다.
LLM-based autonomous agents often fail to execute complex web tasks that require dynamic interaction due to the inherent uncertainty and complexity of these environments. Existing LLM-based web agents typically rely on rigid, expert-designed policies specific to certain states and actions, which lack the flexibility and generalizability needed to adapt to unseen tasks. In contrast, humans excel by exploring unknowns, continuously adapting strategies, and resolving ambiguities through exploration. To emulate human-like adaptability, web agents need strategic exploration and complex decision-making. Monte Carlo Tree Search (MCTS) is well-suited for this, but classical MCTS struggles with vast action spaces, unpredictable state transitions, and incomplete information in web tasks. In light of this, we develop WebPilot, a multi-agent system with a dual optimization strategy that improves MCTS to better handle complex web environments. Specifically, the Global Optimization phase involves generating a high-level plan by breaking down tasks into manageable subtasks and continuously refining this plan, thereby focusing the search process and mitigating the challenges posed by vast action spaces in classical MCTS. Subsequently, the Local Optimization phase executes each subtask using a tailored MCTS designed for complex environments, effectively addressing uncertainties and managing incomplete information. Experimental results on WebArena and MiniWoB++ demonstrate the effectiveness of WebPilot. Notably, on WebArena, WebPilot achieves SOTA performance with GPT-4, achieving a 93% relative increase in success rate over the concurrent tree search-based method. WebPilot marks a significant advancement in general autonomous agent capabilities, paving the way for more advanced and reliable decision-making in practical environments.
연구 동기 및 목표
- 복잡하고 동적이며 부분 관측 가능한 웹 작업을 다루는 데 있어 LLM 기반 웹 에이전트의 한계를 해결하기 위해.
- 유연하고 인간처럼 전략적인 탐색을 가능하게 하여 고정된 전문가 설계 정책의 한계를 극복하기 위해.
- 실제 웹 환경에서 큰 행동 공간, 예측 불가능한 전이, 완전하지 않은 정보를 다룰 수 있도록 몬테카를로 트리 탐색(MCTS)을 향상시키기 위해.
- 미세한 작업 진행 상황과 결과 품질을 포괄하는 복합적인 자기 보상 메커니즘을 개발하기 위해.
- 반사적 계획 수립과 반복적 하위작업 정밀 조정을 통해 예측 불가능한 작업으로의 일반화를 가능하게 하기 위해.
제안 방법
- WebPilot는 이중 최적화 프레임워크를 활용한다: 관찰 및 이전 시도 분석을 통한 반사적 분석을 통해 고수준 계획 분해 및 개선을 위한 글로벌 최적화.
- 국소 최적화는 각 하위작업에 맞춤형으로 설계된 MCTS를 사용하며, PUCT 기반 행동 선택과 탐색 편향을 통해 이용과 탐색의 균형을 맞춘다.
- 새로운 Explorer 모듈은 행동 효과를 평가하고, 즉각적 효과, 향후 상태 잠재력, 하위작업 진행 상황, 목표 일치도의 네 가지 구성 요소를 사용해 종합적인 자기 보상을 생성한다.
- Appraiser 모듈은 효과적 점수와 향후 상태 점수를 학습 가능한 가중치로 조합하여 총 점수를 계산하고, MCTS 노드 선택을 이끌어낸다.
- Controller 모듈은 피드백을 바탕으로 하위작업이 완료되었는지 또는 재계획이 필요한지 결정하여 동적 적응을 가능하게 한다.
- Planner는 완료 신호와 새로운 관찰을 기반으로 작업 분해를 지속적으로 업데이트하여 글로벌 계획의 반복적 정밀 조정을 가능하게 한다.
실험 결과
연구 질문
- RQ1전략적 탐색을 갖춘 다중 에이전트 시스템이 복잡하고 동적인 웹 환경에서 고정된 전문가 설계 정책보다 뛰어난 성능을 낼 수 있는가?
- RQ2실제 웹 작업에서 큰 행동 공간, 예측 불가능한 전이, 완전하지 않은 정보를 다룰 수 있도록 MCTS를 어떻게 향상시킬 수 있는가?
- RQ3반사적 고수준 계획은 장기적인 웹 작업에서 LLM 기반 에이전트의 성공률을 얼마나 향상시킬 수 있는가?
- RQ4즉각적 효과와 향후 상태 평가를 통합한 종합적인 자기 보상 메커니즘이 부분 관측 환경에서의 의사결정을 향상시킬 수 있는가?
- RQ5글로벌 계획과 국소 MCTS 최적화의 통합이 예측 불가능한 웹 작업으로의 일반화를 이끌어낼 수 있는가?
주요 결과
- WebPilot는 GPT-4를 사용해 WebArena 벤치마크에서 이전의 트리 탐색 기반 방법 대비 93%의 상대적 성공률 향상을 달성한다.
- WebArena에서 WebPilot는 동적 상호작용, 부분 관측 가능성, 고정되지 않은 정책, 확장성, 현실적인 환경, 종합적인 자기 보상 등 모든 측면에서 기존 방법을 초월하는 SOTA 성능을 기록한다.
- 시스템은 상태 전이가 불확실하고 정보가 불완전한 복잡한 장기 작업을 효과적으로 처리하는 데 있어 뛰어난 내재성을 보인다.
- 반사적 글로벌 계획과 MCTS 기반 국소 실행을 조합한 이중 최적화 전략은 적응성과 성공률을 크게 향상시킨다.
- 종합적인 자기 보상 메커니즘은 미세한 작업 진행 상황을 효과적으로 포착하여 복잡한 환경에서의 의사결정을 향상시킨다.
- 다양한 벤치마크인 WebArena와 MiniWoB++에서의 성능을 통해 예측 불가능한 작업으로의 일반화 능력이 뛰어나다는 것이 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.