Skip to main content
QUICK REVIEW

[논문 리뷰] Lifelong Robot Learning with Human Assisted Language Planners

Meenal Parakh, Alisha Fong|arXiv (Cornell University)|2023. 09. 25.
Natural Language Processing TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 인간의 보조를 받는 언어 기반 계획을 통해 동적으로 새로운 6-자유도 조작 스킬을 요청하고 습득할 수 있는 종신적 로봇 학습 프레임워크를 제안한다. 데이터 효율적인 스킬 학습을 위해 신경 기술자 필드(Neural Descriptor Fields, NDFs)를 통합함으로써, LLM은 실시간으로 스킬 라이브러리를 확장할 수 있으며, 스킬 설명문(docstrings)을 사용해 새로운 스킬을 75%의 성공률로 향후 작업에 재사용할 수 있다.

ABSTRACT

Large Language Models (LLMs) have been shown to act like planners that can decompose high-level instructions into a sequence of executable instructions. However, current LLM-based planners are only able to operate with a fixed set of skills. We overcome this critical limitation and present a method for using LLM-based planners to query new skills and teach robots these skills in a data and time-efficient manner for rigid object manipulation. Our system can re-use newly acquired skills for future tasks, demonstrating the potential of open world and lifelong learning. We evaluate the proposed framework on multiple tasks in simulation and the real world. Videos are available at: https://sites.google.com/mit.edu/halp-robot-learning.

연구 동기 및 목표

  • 고정된 스킬 라이브러리의 한계를 극복하고, LLM 기반 로봇 계획자가 실제 환경에서 동적으로 새로운 조작 스킬을 요청하고 학습할 수 있도록 하는 것.
  • 특히 측면에서 잡기나 물체를 쌓는 것과 같은 복잡한 6-자유도 동작을 위한 데이터 및 시간 효율성의 낮음을 해결하는 것.
  • 미래의 작업들 간에 새로 습득한 스킬을 재사용할 수 있도록 하는 시스템을 개발하여, 로봇 분야에서 개방형 환경과 종신적 학습을 가능하게 하는 것.
  • 사용자 피드백을 스킬 습득 루프에 통합하여 계획 정확도와 작업 성공률를 향상시키되, 지속적인 인간 간섭에 대한 의존도를 최소화하는 것.

제안 방법

  • 시스템은 자연어로 기술된 작업 설명, 인식 시스템으로부터의 장면 설명, 기존 스킬 라이브러리(파이썬 함수로 표현)를 입력으로 받아 실행 가능한 코드로 계획을 생성하는 LLM 계획자를 사용한다.
  • LLM이 기존 스킬로는 충분하지 않을 경우 새로운 스킬을 요청할 수 있도록 특수한 'learn_skill' 함수를 노출시킨다. 이 함수는 스킬 이름과 기술적 설명문(docstring)을 반환한다.
  • 새로운 스킬은 신경 기술자 필드(NDFs)를 통해 실현되며, 6-자유도 강체 조작 정책을 학습하기 위해 단지 5~10회의 시연만으로도 가능하다.
  • 시연 이후 새로 습득한 스킬은 스킬 라이브러리에 추가되어 향후 작업에서 재사용 가능해진다.
  • LLM은 스킬의 설명문을 바탕으로 그 적용 가능성을 추론하여, 맥락 기반 지능을 통해 계획 정확도를 향상시킨다.
  • 사용자 피드백은 작업 성공 여부 확인과 스킬 습득를 안내하는 데 사용되지만, 시스템은 시간이 지남에 따라 이러한 피드백에 대한 의존도를 줄이려 한다.
Figure 1 : Our system consists of three modules: perception , planning , and control . The perception module processes RGB-D images and outputs a textual scene description that identifies objects and their spatial relationships. The planning module uses GPT-4 to plan a sequence of steps based on the
Figure 1 : Our system consists of three modules: perception , planning , and control . The perception module processes RGB-D images and outputs a textual scene description that identifies objects and their spatial relationships. The planning module uses GPT-4 to plan a sequence of steps based on the

실험 결과

연구 질문

  • RQ1LLM 기반 계획자가 실제 로봇 환경에서 동적으로 새로운 6-자유도 조작 스킬을 요청하고 학습할 수 있는가?
  • RQ2NDF의 통합이 종신적 학습 환경에서 데이터 효율적이고 신속한 스킬 습득을 위해 얼마나 효과적인가?
  • RQ3LLM이 향후 작업에서 새로 습득한 스킬을 얼마나 정확히 재사용할 수 있으며, 스킬 기술의 품질은 이에 어떤 영향을 미치는가?
  • RQ4새로운 스킬이 도입되었을 때 LLM 기반 계획의 실패 유형은 무엇이며, 이는 후속 작업 실행에 어떤 영향을 미치는가?

주요 결과

  • 시스템은 NDF를 활용해 단지 5~10회의 시범만으로도 시뮬레이션 및 실제 환경 모두에서 LLM 기반 계획자가 새로운 조작 스킬을 요청하고 학습하는 데 성공했다.
  • 스킬 이름과 설명문(docstring)이 함께 제공된 경우, LLM은 향후 작업에서 새로 습득한 스킬을 75%의 성공률로 정확히 재사용할 수 있었다.
  • 스킬 이름만 제공된 경우 성공률는 50%로 떨어지며, 이는 LLM 추론에서 맥락 기반 설명의 중요성을 강조한다.
  • LLM은 종종 새로 습득한 스킬을 부적절하게 호출하거나, 약간 다른 이름으로 동일한 스킬을 다시 학습하는 오류를 자주 범하며, 이는 스킬 적용 가능성에 대한 추론의 한계를 보여준다.
  • 인식 시스템에서 유도된 장면 설명의 정확도 부족이 계획 성능에 심각한 영향을 미치며, 이는 입력 품질에 대한 시스템의 민감도를 보여준다.
  • 사용자 피드백은 작업 성공 여부 확인과 스킬 습득에 필수적이지만, 반복적인 의존은 자율성의 제한을 초래하므로, 확장성을 높이기 위해 학습된 성공 검출기의 도입이 필요하다.
Figure 2 : (a) From RGBD images, our perception module obtains information about the objects and their relations, creates an object information dictionary, and generates a scene description ( detection, object pairs corresponding to given object relations, and the template is in black). (b) An examp
Figure 2 : (a) From RGBD images, our perception module obtains information about the objects and their relations, creates an object information dictionary, and generates a scene description ( detection, object pairs corresponding to given object relations, and the template is in black). (b) An examp

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.