[논문 리뷰] Generalized Planning in PDDL Domains with Pretrained Large Language Models
이 논문은 소수의 PDDL 작업 예제로부터 Python 프로그램을 합성함으로써 GPT-4를 사용해 PDDL 도메인에서 일반화된 계획자(generalized planners)를 생성하는 방법을 제안한다. 사고의 사슬(Chain-of-Thought) 프롬프팅과 자동 디버깅을 통해 GPT-4는 강력한 일반화 성능를 보이며, 일반적으로 두 개의 학습 작업만으로도 충분하다. 이는 LLM이 일곱 개의 도메인에서 스케일링 가능하고 해석 가능한 일반화 계획에 있어 강력하고 효율적이며 점검 가능한 도구로 활용될 수 있음을 보여준다.
Recent work has considered whether large language models (LLMs) can function as planners: given a task, generate a plan. We investigate whether LLMs can serve as generalized planners: given a domain and training tasks, generate a program that efficiently produces plans for other tasks in the domain. In particular, we consider PDDL domains and use GPT-4 to synthesize Python programs. We also consider (1) Chain-of-Thought (CoT) summarization, where the LLM is prompted to summarize the domain and propose a strategy in words before synthesizing the program; and (2) automated debugging, where the program is validated with respect to the training tasks, and in case of errors, the LLM is re-prompted with four types of feedback. We evaluate this approach in seven PDDL domains and compare it to four ablations and four baselines. Overall, we find that GPT-4 is a surprisingly powerful generalized planner. We also conclude that automated debugging is very important, that CoT summarization has non-uniform impact, that GPT-4 is far superior to GPT-3.5, and that just two training tasks are often sufficient for strong generalization.
연구 동기 및 목표
- 사전 훈련된 대규모 언어모델(LLM)이 PDDL 도메인에서 작업 계획이 아닌 재사용 가능한 프로그램을 생성함으로써 일반화된 계획자로 기능할 수 있는지 조사하는 것.
- GPT-4가 PDDL 도메인의 미리보기 없는 작업들에 일반화되는 도메인 특화 Python 프로그램을 합성하는 데 있어 효과적인지 평가하는 것.
- 사고의 사슬 요약 및 자동 디버깅과 같은 방법론적 개선 사항이 프로그램의 정확성과 일반화 능력에 미치는 영향을 평가하는 것.
- GPT-4의 성능을 GPT-3.5 및 분리된 베이스라인과 비교하여 데이터 효율성과 내성적 안정성 분석하는 것.
- 기존 방법이 복잡하거나 비현실적인 도메인에서 LLM을 사용한 일반화 계획의 가능성 탐색
제안 방법
- PDDL 도메인과 소수의 학습 작업(모두 PDDL로 인코딩됨)을 GPT-4에 프롬프트하여, 작업 설명을 입력으로 받아 계획을 출력하는 Python 프로그램을 생성한다.
- 사고의 사슬(CoT) 프롬프팅을 통합하여, GPT-4가 먼저 도메인을 요약하고 자연어로 해결 전략을 제안한 후 코드를 작성하도록 지시한다.
- 자동 디버깅 적용: 생성된 프로그램을 학습 작업에 대해 실행; 실패할 경우 예외 등의 피드백을 제공하고 최대 네 번까지 재프롬프팅하여 오류를 수정한다.
- 학습 작업에 대해 프로그램을 검증하고 피드백 루프를 통해 반복적으로 향상시키는 파이프라인을 사용한다.
- 검색 기반 계획을 피하고 지침에 따라 단순한 비검색 전략을 선호하는 프로그램을 합성한다.
- 기존 연구에서 사용한 여섯 개의 도메인과 하나의 신규 도메인을 포함한 일곱 개의 PDDL 도메인에서 평가하며, 분리된 사례와 베이스라인과 비교한다.

실험 결과
연구 질문
- RQ1GPT-4는 소수의 예제로부터 재사용 가능한 Python 프로그램을 생성함으로써 PDDL 도메인에서 일반화된 계획자를 효과적으로 합성할 수 있는가?
- RQ2사고의 사슬 프롬프팅은 합성된 일반화 계획의 품질과 정확성에 어떤 영향을 미치는가?
- RQ3자동 디버깅은 LLM이 생성한 계획자의 신뢰성과 일반화 능력에 얼마나 기여하는가?
- RQ4다양한 PDDL 도메인에서 GPT-4는 GPT-3.5보다 성능 면에서 뛰어나며, 일반화 계획 능력에서 뛰어난 추론 및 코드 생성 능력을 보여주는가?
- RQ5강력한 일반화를 위해 최소 몇 개의 학습 작업이 필요한가? 그리고 예제 수가 줄어들면 성능이 떨어지는가?
주요 결과
- GPT-4는 놀랍도록 강력한 일반화 계획자이며, 일곱 개의 PDDL 도메인에서 여러 베이스라인과 분리된 사례를 모두 초월한다.
- 자동 디버깅은 필수적이다: 이를 적용하지 않으면 GPT-4는 자주 잘못되거나 기능하지 않는 코드를 생성하지만, 자동 디버깅을 적용하면 성공률이 크게 향상된다.
- 사고의 사슬 프롬프팅은 일관되게 유익하지는 않으며, 일부 도메인에선 유용하지만 전반적으로는 일관되지 않은 영향을 미친다.
- GPT-4는 GPT-3.5를 크게 능가하며, 일반화 계획 분야에서 뛰어난 추론 능력과 코드 생성 능력을 보여준다.
- 보통 두 개의 학습 작업만으로도 강력한 일반화가 가능하며, 자동 디버깅 과정에서 세 번째 작업이 필요한 경우가 소수에 불과하다.
- PDDL 이름을 제거한 상황에서도 LLM은 구조적 구문적 특징을 기반으로 효과적으로 일반화할 수 있으며, 이는 이름이 대부분의 경우 성능 향상에 기여하지만, 이름이 없어도 일반화가 가능하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.