Skip to main content
QUICK REVIEW

[논문 리뷰] Interactive Task Planning with Language Models

Boyi Li, Philipp Wu|arXiv (Cornell University)|2023. 10. 16.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 GPT-4와 같은 대규모 언어모델(LLM)을 사용하여 실시간으로 상호작용하는 로봇 작업 계획 및 재계획을 가능하게 하는 훈련이 필요 없는 ITP(인터랙티브 작업 계획)을 제안한다. 고수준의 자연어 계획과 저수준의 스킬 실행을 기능적 API를 통해 통합하여, 프롬프트 엔지니어링이나 재훈련 없이도 제로샷 접시세척 작업에서 100% 성공을 달성하고 새로운 목표에 대해 강력하게 적응한다.

ABSTRACT

An interactive robot framework accomplishes long-horizon task planning and can easily generalize to new goals and distinct tasks, even during execution. However, most traditional methods require predefined module design, making it hard to generalize to different goals. Recent large language model based approaches can allow for more open-ended planning but often require heavy prompt engineering or domain specific pretrained models. To tackle this, we propose a simple framework that achieves interactive task planning with language models by incorporating both high-level planning and low-level skill execution through function calling, leveraging pretrained vision models to ground the scene in language. We verify the robustness of our system on the real world task of making milk tea drinks. Our system is able to generate novel high-level instructions for unseen objectives and successfully accomplishes user tasks. Furthermore, when the user sends a new request, our system is able to replan accordingly with precision based on the new request, task guidelines and previously executed steps. Our approach is easy to adapt to different tasks by simply substituting the task guidelines, without the need for additional complex prompt engineering. Please check more details on our https://wuphilipp.github.io/itp_site and https://youtu.be/TrKLuyv26_g.

연구 동기 및 목표

  • 사용자 피드백에 따라 작업 실행 중에 동적으로 재계획을 수행할 수 있는 훈련이 필요 없는 상호작용형 로봇 시스템을 개발하는 것.
  • 로봇 작업 계획에서 복잡한 프롬프트 엔지니어링이나 코드 수준의 사양이 필요 없도록 제거하는 것.
  • 사전 정의된 저수준 스킬 API와 작업 지침만을 사용하여 새로운 작업으로의 일반화를 가능하게 하는 것.
  • 음료 제조 및 접시세척과 같은 실제 로봇 응용 분야에서 강력한 고수준 계획 및 실행을 보여주는 것.
  • 다양한 로봇 작업에 빠르게 적응할 수 있도록 유연하고 오픈소스인 프레임워크를 만드는 것.

제안 방법

  • 시스템은 사용자 요청과 작업 지침을 바탕으로 단계별 지시를 생성하는 GPT-4를 고수준 계획자로 사용한다.
  • 저수준 로봇 스킬은 기능 기반 언어 인터페이스(API)로 추상화되어, LLM이 코드 수준의 프롬프트 엔지니어링 없이 직접 함수를 호출할 수 있도록 한다.
  • 완료된 단계는 '기억'되어 재계획 과정에서 맥락으로 사용되며, 이로써 시스템은 실행 중 사용자 요청에 적응할 수 있다.
  • 프레임워크는 자연어 프롬프트와 작업 지침에만 의존하며, 미세조정이나 추가 가치 함수의 필요성을 피한다.
  • 시각 모델인 Grounded-DINO을 통합하여 물체를 탐지하고 국소화하고, 시각적 입력을 LLM에 공급하여 기반된 계획을 수행한다.
  • 새로운 사용자 요청, 이전에 실행된 단계, 그리고 작업 지침을 조합하여 업데이트된 실행 가능한 계획을 동적으로 재계획한다.

실험 결과

연구 질문

  • RQ1LLM 기반 시스템이 미세조정이나 복잡한 프롬프트 엔지니어링 없이도 새로운 작업에 대해 정확하고 실행 가능한 고수준 계획을 생성할 수 있는가?
  • RQ2이러한 시스템은 실행 중 사용자 요청에 얼마나 잘 적응할 수 있는가? 이전에 완료된 단계와 업데이트된 목표를 어떻게 통합하는가?
  • RQ3같은 프레임워크가 작업 지침과 스킬 API만 수정하여 서로 다른 로봇 작업 간에 얼마나 잘 일반화되는가?
  • RQ4새로운 조합의 물체와 목표를 제로샷으로 만나면, 시스템이 계획의 정확성과 작업 일치성을 유지할 수 있는가?
  • RQ5저수준 스킬에 기능적 API 추상화를 사용할 경우, 시스템의 강건성과 배포 용이성에 어떤 영향을 미치는가?

주요 결과

  • 시스템은 제로샷 접시세척 작업에서 100% 성공률를 기록했으며, 27개의 새로운 요청 중 27개에 대해 정확한 고수준 계획을 생성했다.
  • ITP는 지침에 명시되지 않은 새로운 음료 레시피(예: 타로 밀크, 말차 밀크 with 보바)에 대해서도 실행 가능한 계획을 성공적으로 생성했다.
  • 실행 중 새로운 사용자 요청에 대해 정확하게 계획을 조정함으로써 강력한 재계획 능력을 입증했으며, 기억된 완료된 단계와 업데이트된 목표를 활용했다.
  • 새로운 작업으로의 일반화에는 작업 지침과 저수준 스킬 정의만 업데이트하면 되었으며, 핵심 계획 및 실행 파이프라인에 대한 변경 사항이 없었다.
  • 코드 수준의 프롬프트 엔지니어링이나 가치 함수 학습이 필요 없어졌으며, 이는 새로운 작업에 대한 배포를 크게 단순화시켰다.
  • 다양하고 복잡한 작업 조합, 예를 들어 다중 물체, 다중 위치의 접시세척 요청에서도 계획의 정확성과 진짜 목표와의 일치성을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.