[논문 리뷰] ISR-LLM: Iterative Self-Refined Large Language Model for Long-Horizon Sequential Task Planning
ISR-LLM는 자연어를 PDDL로 변환하고, 초기 계획을 생성한 후 검증자 피드백을 통해 계획을 반복적으로 개선하는 반복적 자기개선 프레임워크를 제안한다. 이는 자연어 유연성을 유지하면서도 최신 기술 수준의 LLM 기반 계획기보다 훨씬 높은 작업 성공률를 달성한다.
Motivated by the substantial achievements observed in Large Language Models (LLMs) in the field of natural language processing, recent research has commenced investigations into the application of LLMs for complex, long-horizon sequential task planning challenges in robotics. LLMs are advantageous in offering the potential to enhance the generalizability as task-agnostic planners and facilitate flexible interaction between human instructors and planning systems. However, task plans generated by LLMs often lack feasibility and correctness. To address this challenge, we introduce ISR-LLM, a novel framework that improves LLM-based planning through an iterative self-refinement process. The framework operates through three sequential steps: preprocessing, planning, and iterative self-refinement. During preprocessing, an LLM translator is employed to convert natural language input into a Planning Domain Definition Language (PDDL) formulation. In the planning phase, an LLM planner formulates an initial plan, which is then assessed and refined in the iterative self-refinement step by using a validator. We examine the performance of ISR-LLM across three distinct planning domains. The results show that ISR-LLM is able to achieve markedly higher success rates in task accomplishments compared to state-of-the-art LLM-based planners. Moreover, it also preserves the broad applicability and generalizability of working with natural language instructions.
연구 동기 및 목표
- 장기 순차적 작업 계획에서 LLM이 생성한 계획의 낮은 타당성과 정확성 문제를 해결하기 위해.
- 수동으로 기호 도메인을 정의하지 않고도 LLM이 일반화 가능하고 작업에 종속되지 않는 계획기로 작동할 수 있도록 하기 위해.
- 검증자 피드백을 통한 반복적 자기개선 루프를 통해 계획의 신뢰성을 향상시키기 위해.
- 사람이 참여하는 계획 과정을 위해 자연어 지시어와의 호환성을 유지하기 위해.
제안 방법
- 두 단계로 구성된 LLM 파이프라인: 첫 번째로 번역기 LLM이 자연어 지시어를 형식적인 PDDL 표현으로 변환한다.
- LLM 계획기에서 PDDL로 표현된 문제로부터 초기 행동 시퀀스를 생성한다.
- 검증자가 액션을 시뮬레이션하고 논리적 또는 물리적 오류가 있는지 확인함으로써 계획의 정확성을 평가한다.
- LLM 계획기는 검증자 피드백에 기반해 계획을 반복적으로 개선하며, 유효한 계획이 생성될 때까지 반복한다.
- 검증자가 계획의 정확성과 목표 달성 여부를 추론하는 데 도움이 되도록 소수의 예시를 사용한다.
- 종단 간 자연어 상호작용을 유지하면서도 반복적 수정을 통해 형식적인 계획의 타당성을 보장한다.
실험 결과
연구 질문
- RQ1기본적인 LLM 기반 계획기와 비교해 볼 때, 반복적 자기개선이 LLM 기반 장기 계획의 성공률를 뚜렷이 향상시키는가?
- RQ2높은 계획 정확성을 달성하면서도 LLM이 일반화 능력과 인간이 이해할 수 있는 지시어 처리 능력을 어느 정도 유지할 수 있는가?
- RQ3검증자 기반 피드백 루프는 복잡하고 시간적으로 종속된 행동 시퀀스에서 오류를 탐지하고 수정하는 데 얼마나 효과적인가?
- RQ4PDDL 변환 단계가 의미적 충실도를 유지하고 신뢰할 수 있는 후속 계획을 가능하게 하는가?
주요 결과
- ISR-LLM는 세 가지 서로 다른 계획 도메인에서 최신 기술 수준의 LLM 기반 계획기보다 뚜렷이 높은 작업 성공률를 달성한다.
- Blocksworld 도메인에서 ISR-LLM는 테스트 케이스 6개 중 5개를 정확하게 검증했으며, 비어 있지 않은 객체 위에 쌓는 것과 같은 잘못된 행동을 검증자가 성공적으로 탐지했다.
- 이 프레임워크는 비어 있지 않은 블록 위에 쌓는 것을 尝시는 등의 계획 오류를 식별하고 수정하여 개선 과정에서 효과적인 오류 탐지 능력을 보였다.
- 반복적 자기개선 과정은 실행 체인의 초기 단계에서 잘못된 행동을 조기에 탐지함으로써 잘못된 행동 시퀀스를 줄였다.
- 검증자는 목표 상태 달성 여부를 일관되게 확인했으며, 최종 계획이 논리적으로 타당하고 목표에 부합한다는 점을 확인했다.
- 시스템은 자연어 입력과의 높은 호환성을 유지하면서도 형식적인 정확성을 훼손하지 않고 인간이 참여하는 계획 과정을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.