[논문 리뷰] PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about Change
PlanBench는 IPC 스타일의 계획 도메인(Blocksworld와 Logistics)을 사용하는 확장 가능한 벤치마크 모음으로, 변경에 대한 계획 및 추론에서 LLM을 평가합니다; 결과는 GPT-4와 InstructGPT-3 같은 현재 LLM이 많은 계획 작업에서 어려움을 겪고 있음을 보여줍니다.
Generating plans of action, and reasoning about change have long been considered a core competence of intelligent agents. It is thus no surprise that evaluating the planning and reasoning capabilities of large language models (LLMs) has become a hot topic of research. Most claims about LLM planning capabilities are however based on common sense tasks-where it becomes hard to tell whether LLMs are planning or merely retrieving from their vast world knowledge. There is a strong need for systematic and extensible planning benchmarks with sufficient diversity to evaluate whether LLMs have innate planning capabilities. Motivated by this, we propose PlanBench, an extensible benchmark suite based on the kinds of domains used in the automated planning community, especially in the International Planning Competition, to test the capabilities of LLMs in planning or reasoning about actions and change. PlanBench provides sufficient diversity in both the task domains and the specific planning capabilities. Our studies also show that on many critical capabilities-including plan generation-LLM performance falls quite short, even with the SOTA models. PlanBench can thus function as a useful marker of progress of LLMs in planning and reasoning.
연구 동기 및 목표
- PlanBench를 도입하여 다양한 도메인에서 LLM의 계획 및 추론을 평가하기 위한 확장 가능한 벤치마크를 소개한다.
- 벤치마크를 고전적 계획 형식(PDDL)에 기반시켜 LLM 출력의 제약 및 테스트를 강화한다.
- 계획 생성, 비용 최적 계획, 검증, 실행 추론, 재계획, 일반화, 재사용, 견고성 등 8개의 과제 커리큘럼을 제공하여 계획 능력을 평가한다.
- 도메인 독립적 평가 프레임워크와 도메인 의존적 구성요소(도메인, 문제 생성, 번역)로 프롬프트 생성 및 계획 검증을 위한 도메인 독립적 평가 프레임워크를 제시한다.
- 도메인 명칭에 대한 강건성을 테스트하기 위한 도메인 은폐를 포함한 약 26,250개의 프롬프트 데이터셋을 제공한다.
- state-of-the-art LLM으로 기초선을 제시하여 현재 능력을 정량화하고 향후 개선을 가이드한다.
제안 방법
- 심볼릭 플래너와 계획 검증기에 고정된 도메인 독립적 계획 평가 프레임워크를 정의한다.
- lifted 도메인 모델, 문제 생성기, 자연어로의 번역 및 형식적 표현으로의 역번역 등 도메인 의존적 구성요소를 이용한다.
- PDDL 유사 문제를 자연어 프롬프트로 번역하고 LLM의 출력을 계획 표현으로 다시 파싱하여 검증한다.
- IPC 도메인 전반에 걸친 8개의 테스트 케이스 커리큘럼(7개의 계획/추론 과제 포함)을 약식 프롬프트와 추출용 계획 엔드 마커와 함께 사용한다.
- 표면적 명칭에 의한 의존성을 줄이고 기저의 추론 패턴에 대한 견고성을 테스트하기 위해 도메인을 은폐한다.
- 프롬프트 및 결과를 위한 도구, 데이터셋, 재현 스크립트를 포함한 공개 저장소를 제공한다.
실험 결과
연구 질문
- RQ1일반 상식적 계획 도메인에서 LLM이 명시적 목표를 달성하는 유효한 계획을 생성할 수 있는가?
- RQ2LLM이 제약 하에서 비용 최적의 계획을 생성하고 계획의 유효성을 검증할 수 있는가?
- RQ3LLM이 계획의 실행에 대해 추론하고 행동의 결과를 예측할 수 있는가?
- RQ4목표 재정식화, 계획 재사용 및 변경 시 재계획에 대해 LLM은 얼마나 견고한가?
- RQ5학습된 계획 패턴을 새로운 인스턴스나 은폐된 도메인에 일반화할 수 있는가?
주요 결과
- GPT-4는 계획 생성에서 34.3% 정답(206/600), 비용 최적 계획에서 33.0% 정답(198/600)을 달성했다.
- InstructGPT-3은 계획 생성에서 6.8% 정답(41/600), 비용 최적 계획에서 5.8% 정답(35/600)을 달성했다.
- 계획 검증은 GPT-4에서 58.6% 정답(352/600)이고 InstructGPT-3은 12%에 불과하다(72/600).
- Plan 실행에 대한 추론은 GPT-4에서 31.8%로 도달했으나 InstructGPT-3은 0.6%에 불과했다(4/600).
- 재계획은 GPT-4에서 48.1%를 달성했고 InstructGPT-3은 6.6%에 그쳤다(40/600).
- 계획 일반화는 GPT-4에서 28.2%로, InstructGPT-3은 9.8%에 그쳤다(49/500).
- 계획 재사용은 GPT-4에서 65.3%로 나타났고 InstructGPT-3은 17%였다(102/600).
- 목표 재정식화(셔플링)에 대한 견고성은 GPT-4에서 76.8%이고 InstructGPT-3은 77.8%이다(461/600, 467/600).
- 목표 재정식화(Full→Partial)에 대한 견고성은 GPT-4에서 87%이고 InstructGPT-3은 77.8%이다(522/600, 467/600).
- 목표 재정식화(Partial→Full)에 대한 견고성은 GPT-4에서 58%이고 InstructGPT-3은 60.5%이다(348/600, 363/600).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.