Skip to main content
QUICK REVIEW

[논문 리뷰] Foundation Model based Open Vocabulary Task Planning and Executive System for General Purpose Service Robots

Yoshiki Obinata, Naoaki Kanazawa|arXiv (Cornell University)|2023. 08. 07.
Robotics and Automated SystemsEngineering인용 수 3
한 줄 요약

이 논문은 일반 목적의 서비스 로봇을 위한 기초 모델 기반의 오픈 뷰어티(Task Planning and Executive) 시스템을 제안하며, 대규모 언어 모델(Large Language Models, LLMs)과 시각-언어 모델(Vision-Language Models, VLMs)을 상태 기반 실행기와 통합하여 실제 환경에서 음성 명령어를 안정적이고 견고하게 수행할 수 있도록 한다. 이 시스템은 2022년 로보컵@홈 재팬 오픈 GPSR 대회에서 130점으로 1등을 차지하여 다른 팀들보다 뚜렷이 뛰어난 성능을 보였다.

ABSTRACT

This paper describes a strategy for implementing a robotic system capable of performing General Purpose Service Robot (GPSR) tasks in robocup@home. The GPSR task is that a real robot hears a variety of commands in spoken language and executes a task in a daily life environment. To achieve the task, we integrate foundation models based inference system and a state machine task executable. The foundation models plan the task and detect objects with open vocabulary, and a state machine task executable manages each robot's actions. This system works stable, and we took first place in the RoboCup@home Japan Open 2022's GPSR with 130 points, more than 85 points ahead of the other teams.

연구 동기 및 목표

  • 일상 생활 환경에서 다양한 음성 명령어를 이해하고 실행할 수 있도록 일반 목적의 서비스 로봇을 가능하게 하기 위해.
  • 기초 모델을 활용한 오픈 뷰어티 이해 및 동작 계획 도전 과제를 해결하기 위해.
  • 장애나 모호함이 발생하더라도 상태 기반 실행기로 안정적이고 결정적인 로봇 행동을 보장하기 위해.
  • 사용자 피드백과 반복적 개선을 통해 현장 환경 지식을 통합하고 장애를 처리하기 위해.
  • LLMs, VLMs, 그리고 실행 가능한 상태 기반 기계를 통합하여 실제 환경 실행의 견고성을 향상시키기 위해.

제안 방법

  • 시스템은 대규모 언어 모델(GPT-3)을 사용하여 음성 명령어를 원시 동작의 시퀀스로 해석한다.
  • 시각-언어 모델(OFA, Detic)을 통해 오픈 뷰어티 객체 탐지 및 시각적 질의 응답을 가능하게 한다.
  • 상태 기반 실행기(task executor)는 동작 시퀀스를 관리하며, 각 원시 기능의 성공 또는 실패에 따라 결정적 전이를 수행한다.
  • 원시 기능으로는 move_to, grasp, follow, pass_to, speak, answer, visual_question_answering 등이 포함된다.
  • 환경의 물체 위치 및 공간적 관계와 같은 자연어 기반 기술을 통해 현장 지식을 LLM에 통합한다.
  • 장애 처리로는 동작 재시도, 인간의 지시 요청, 피드백을 통한 향후 실행 개선이 포함된다.

실험 결과

연구 질문

  • RQ1기초 모델과 상태 기반 실행기를 효과적으로 조합하여 오픈 뷰어티, 실제 환경에서의 작업에 대해 안정적이고 결정적인 로봇 행동을 달성할 수 있는가?
  • RQ2LLMs와 VLMs가 함께 작용하여 일상 생활 환경에서 복잡한 자연어 명령어를 안정적으로 이해할 수 있는가?
  • RQ3물체 위치 및 공간 배치와 같은 현장 환경 지식을 기초 모델의 추론에 효과적으로 통합할 수 있는가?
  • RQ4원시 기능이 예측 불가능하게 실패할 경우, 로봇 작업 실행의 장애 탐지 및 복구를 향상시키는 메커니즘은 무엇인가?
  • RQ5기초 모델과 상태 기반 기계의 하이브리드 시스템이 실제 서비스 로봇 대회에서 기존의 규칙 기반 또는 학습 전용 접근 방식을 얼마나 뛰어나게 성능을 낼 수 있는가?

주요 결과

  • 제안된 시스템은 2022년 로보컵@홈 재팬 오픈 GPSR 대회에서 총 130점으로 1등을 차지하였다.
  • 시스템은 2등 팀보다 85점 이상 높은 점수를 기록하여 오픈 뷰어티 작업 실행에서 뛰어난 성능을 입증하였다.
  • LLMs를 통한 작업 계획과 VLMs를 통한 시각적 이해의 통합으로 강력한 오픈 뷰어티 객체 탐지 및 언어 기반 지도가 가능해졌다.
  • 상태 기반 실행기로 인해 장애 발생 시에도 결정적 행동을 유지하여 실행 중 안정성과 신뢰성이 향상되었다.
  • 원시 기능의 실패 시 사용자에게 명확화를 요청하는 프롬프트를 통해 모호하거나 불완전한 명령어를 효과적으로 처리하였다.
  • 연구자들은 그라우브 중 물체가 떨어지는 등의 미세한 장애를 탐지하는 데 어려움이 있음을 파악하였으며, 향후 향상된 피드백 메커니즘과 데이터 수집의 필요성을 강조하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.