[논문 리뷰] Agent Planning with World Knowledge Model
이 논문은 전문가 및 샘플링된 트레이ector리에서 유전적 작업 지식과 동적 상태 지식을 통합하여 LLM 기반 에이전트 계획 성능을 향상시키는 파rametric World Knowledge Model (WKM)을 제안한다. kNN 검색과 가중치가 부여된 액션 예측을 통해 이 지식을 에이전트의 계획 과정에 통합함으로써, 환각적 행동과 시도 오류를 크게 줄였으며, Mistral-7B, Gemma-7B, Llama-3-8B와 같은 오픈소스 LLM을 사용한 세 가지 실제 시뮬레이션 환경에서 최신 기술 수준의 성능을 달성하였다.
Recent endeavors towards directly using large language models (LLMs) as agent models to execute interactive planning tasks have shown commendable results. Despite their achievements, however, they still struggle with brainless trial-and-error in global planning and generating hallucinatory actions in local planning due to their poor understanding of the ``real'' physical world. Imitating humans' mental world knowledge model which provides global prior knowledge before the task and maintains local dynamic knowledge during the task, in this paper, we introduce parametric World Knowledge Model (WKM) to facilitate agent planning. Concretely, we steer the agent model to self-synthesize knowledge from both expert and sampled trajectories. Then we develop WKM, providing prior task knowledge to guide the global planning and dynamic state knowledge to assist the local planning. Experimental results on three complex real-world simulated datasets with three state-of-the-art open-source LLMs, Mistral-7B, Gemma-7B, and Llama-3-8B, demonstrate that our method can achieve superior performance compared to various strong baselines. Besides, we analyze to illustrate that our WKM can effectively alleviate the blind trial-and-error and hallucinatory action issues, providing strong support for the agent's understanding of the world. Other interesting findings include: 1) our instance-level task knowledge can generalize better to unseen tasks, 2) weak WKM can guide strong agent model planning, and 3) unified WKM training has promising potential for further development. The code is available at https://github.com/zjunlp/WKM.
연구 동기 및 목표
- 낮은 세계 이해도로 인한 계획 과제에서의 막연한 시도 오류와 환각적 행동 등 LLM 기반 에이전트의 한계를 해결한다.
- 전반적인 사전 지식과 지역적 동적 상태 인식을 모두 모델링하여 LLM과 인간과 유사한 계획 능력 간 격차를 메운다.
- 수동적인 프롬프트 없이 트레이젝터리에서 작업 지식과 상태 지식을 생성하는 학습 가능한 파rametric World Knowledge Model (WKM)을 개발한다.
- 미리 정의된 태스크나 프롬프트 없이도 새로운 태스크로 일반화 가능하게 하고, 최소한의 추론 오버헤드로 지식 증강 계획을 지원한다.
- 다양한 환경과 LLM 아키텍처, 특히 강력한 오픈소스 모델들에서 WKM의 유효성을 입증한다.
제안 방법
- 에이전트 모델을 사용해 전문가 트레이젝터리와 샘플링된 트레이젝터리를 비교함으로써, 핵심 계획 단계와 일반 지식 제약 조건을 자가 합성하여 작업 지식을 생성한다.
- 이전 및 다음 액션의 맥락을 활용해 에이전트에 현재 세계 상태를 요약하도록 프롬프트하여 각 계획 단계에 대한 상태 지식을 생성한다.
- 액션 전이와 연결된 자연어 기반 세계 상태 기술을 저장함으로써 상태 지식 기반을 구축한다.
- LoRA 미세조정을 통해 동일한 LLM 기반 구조를 공유함으로써 WKM을 에이전트 모델과 통합하여 파rameter 효율성을 확보한다.
- 추론 과정에서 현재 액션을 쿼리로 사용해 상태 지식 기반에서 kNN 검색을 수행하여 관련된 상태 표현을 검색한다.
- 검색된 상태 지식, 이전 액션 맥락, 에이전트 모델의 확률을 가중치가 부여된 예측에 통합하여 다음 액션을 예측함으로써 환각을 줄인다.
실험 결과
연구 질문
- RQ1자기 합성 월드 지식 모델이 LLM 기반 에이전트 계획에서 막연한 시도 오류와 환각적 행동을 줄일 수 있는가?
- RQ2고정형 또는 수동으로 설계된 프롬프트에 비해 인스턴스 수준의 작업 지식은 새로운 태스크로 얼마나 잘 일반화되는가?
- RQ3약한 WKM이 강력한 에이전트 모델을 효과적으로 이끌 수 있는가? 이는 약한 지도자-강한 피아노 파라다임의 타당성을 입증한다.
- RQ4통합된 다중 작업 WKM 훈련은 다양한 환경에서 더 나은 일반화와 확장성을 제공하는가?
- RQ5명시적인 상태 지식 제공은 에이전트 계획 성능에 어떤 영향을 미치는가? 성능 향상 또는 저하가 발생하는가?
주요 결과
- 제안된 WKM은 뇌절적 시도 오류와 유효하지 않은 행동을 크게 줄였으며, ALFWorld, WebShop, ScienceWorld에서의 성공률 향상 결과를 실증적으로 입증했다.
- 수동으로 설계된 프롬프트나 고정형 프롬프트에 비해 모델이 생성한 인스턴스 수준의 작업 지식은 새로운 태스크로 더 잘 일반화되며, 분포 이질성에 대한 강건성을 보였다.
- 약한 지도자-강한 피아노 파라다임은 타당하다: 심지어 약한 WKM도 강력한 LLM 기반 에이전트를 효과적으로 이끌 수 있었으며, 계획에서 지식 증류의 확장성 잠재력을 입증했다.
- 다양한 작업에 걸쳐 통합된 WKM 훈련은 향후 개발에 매우 유망한 잠재력을 보였으며, 다중 작업 지식 학습이 일반화 능력을 향상시킬 수 있음을 시사한다.
- 추론 과정에서 상태 지식을 명시적으로 제공하는 것은 성능을 떨어뜨릴 수 있으며, 이는 지식 기반에서 동적 검색이 정적 삽입보다 더 효과적임을 시사한다.
- 이 방법은 Mistral-7B, Gemma-7B, Llama-3-8B와 같은 세 가지 오픈소스 LLM을 사용해 세 가지 복잡한 시뮬레이션 환경에서 최신 기술 수준의 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.