[논문 리뷰] Vision-Language Interpreter for Robot Task Planning
이 논문은 자연어 지시와 환경 관찰에서 구문적으로 올바르고 실행 가능한 PDDL 문제 기술서(PD)를 생성하는 시각-언어 인터프리터인 ViLaIn을 제안한다. 이를 통해 기호적 로봇 계획기들이 해석 가능하고 논리적으로 타당한 계획을 도출할 수 있다. ViLaIn은 모든 도메인에서 99% 이상의 구문 정확도를 달성하였고, 유효한 계획 생성 성공률는 58% 이상을 기록하였다. 계획기 피드백을 통한 보완과 새로운 데이터셋(ProDG)을 활용한 평가를 통해 성능을 햖थ하였다.
Large language models (LLMs) are accelerating the development of language-guided robot planners. Meanwhile, symbolic planners offer the advantage of interpretability. This paper proposes a new task that bridges these two trends, namely, multimodal planning problem specification. The aim is to generate a problem description (PD), a machine-readable file used by the planners to find a plan. By generating PDs from language instruction and scene observation, we can drive symbolic planners in a language-guided framework. We propose a Vision-Language Interpreter (ViLaIn), a new framework that generates PDs using state-of-the-art LLM and vision-language models. ViLaIn can refine generated PDs via error message feedback from the symbolic planner. Our aim is to answer the question: How accurately can ViLaIn and the symbolic planner generate valid robot plans? To evaluate ViLaIn, we introduce a novel dataset called the problem description generation (ProDG) dataset. The framework is evaluated with four new evaluation metrics. Experimental results show that ViLaIn can generate syntactically correct problems with more than 99\% accuracy and valid plans with more than 58\% accuracy. Our code and dataset are available at https://github.com/omron-sinicx/ViLaIn.
연구 동기 및 목표
- 자연어 및 시각 입력에서 기계가 읽을 수 있고 실행 가능한 문제 기술서(PD)를 생성함으로써 언어 유도형 기반 기호적 로봇 계획을 연결하고자 한다.
- 기호적 계획기를 활용해 인간이 읽을 수 있고 논리적으로 타당한 계획을 도출함으로써 로봇 작업 계획의 해석 가능성성을 향상시키고자 한다.
- 세부 튜닝 없이도 의미적·구문적으로 정확한 PD를 생성하는 데 도전하며, 대규모 언어 모델 및 시각-언어 모델만을 사용하고자 한다.
- 새로운 데이터셋과 정확도 및 계획 유효성 모두를 평가하는 새로운 평가 지표를 활용해 프레임워크를 평가하고자 한다.
제안 방법
- ViLaIn은 언어 지시와 이미지 관찰에서 PDDL 문제 기술서의 도메인, 초기 상태(I), 목표 상태(G)를 생성하기 위한 3단계 모듈러 패이프라인을 사용한다.
- 프레임워크는 최신 대규모 언어 모델(LLM)과 시각-언어 모델을 사용한 소수의 예제 프롬프팅을 활용해 각 PD 구성 요소를 생성한다.
- 기호적 계획기로부터의 피드백을 활용해 생성된 PD를 보완하기 위해 수정 재프롬프팅(CR)과 사고의 흐름(CoT) 프롬프팅을 통합한다.
- 기호적 계획기(Fast Downward)는 생성된 PD를 검증하며, 실패한 피드백은 PD의 오류를 반복적으로 수정하는 데 사용된다.
- 모듈러성과 성능 간의 상충를 평가하기 위해 전체 PD를 한 번에 생성하는 새로운 엔드 투 엔드 생성 변형인 ViLaIn_whole을 제안한다.
- 프레임워크는 요리, 블록 월드, 하노이의 탑 도메인을 포함하는 새로운 데이터셋(ProDG)을 사용해 평가되었으며, 네 가지의 새로운 평가 지표가 도입되었다.
실험 결과
연구 질문
- RQ1비세부 튜닝으로도 시각-언어 모델이 자연어 및 시각 입력에서 구문적으로 정확하고 의미적으로 타당한 PDDL 문제 기술서를 생성할 수 있는가?
- RQ2수정 재프롬프팅과 사고의 흐름 프롬프팅은 생성된 PD의 품질 향상에 얼마나 효과적인가?
- RQ3모듈러적 vs 엔드 투 엔드 PD 생성 방식이 계획 유효성과 구문 정확성에 미치는 영향은 어떠한가?
- RQ4특히 복잡한 관계적 환경인 블록 월드와 같은 다양한 계획 도메인에서 프레임워크의 성능은 어떻게 변화하는가?
- RQ5기호적 계획기의 피드백은 생성된 문제 기술서의 정확성과 일관성 향상에 얼마나 기여하는가?
주요 결과
- ViLaIn은 모든 도메인에서 99.0% 이상의 구문 정확도를 달성하였으며, 요리 및 하노이 도메인에서는 100%의 구문 정확도를 기록하였다.
- 전반적으로 유효한 로봇 계획을 58.0%의 정확도로 생성하였으며, 요리 도메인에선 100%, 하노이 도메인에선 94.0%의 성공률를 기록하였다.
- 블록 월드 도메인에서는 ViLaIn의 계획 성공률는 58.0%였지만, 전반적 정확도 점수는 13.0%로 떨어졌으며, 이는 블록 관계 서술에 오류가 있음을 시사한다.
- 수정 재프롬프팅(CR)은 성능 향상에 뚜렷한 기여를 하였다. 요리 도메인에서 CR을 제거하면 전반적 정확도 점수는 0.71에서 0.09로 급격히 하락하였다.
- 사고의 흐름(CoT) 프롬프팅은 핵심적인 역할을 한다. CoT를 제거하면 전반적 정확도 점수는 0.71에서 0.59로 감소하였으며, 이는 환상적 생성을 줄이는 데 기여함을 보여준다.
- 엔드 투 엔드 생성(ViLaIn_whole)은 하노이 도메인에서 모듈러 버전을 능가하며, 생성 과정에서 토큰 간 거리가 가까운 것이 관계 일致성 향상에 기여함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.