Skip to main content
QUICK REVIEW

[논문 리뷰] Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models

Bangguo Yu, Yuan, Qihao|arXiv (Cornell University)|2023. 10. 11.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

Co-NavGPT는 환경 프롬프트를 기반으로 로봇에 탐색 프론티어를 할당하는 대규모 언어 모델(Large Language Models, LLMs)을 글로벌 플래너로 사용하는 새로운 다중 로봇 시각적 의미 탐색 프레임워크이다. 지ap features를 자연어 프롬프트로 인코딩하여, 학습 없이도 제로샷(cooperative navigation)을 가능하게 하며, HM3D에서 66.1%의 성공률과 평균 목표 도달 시간 1.831을 기록하여 모든 기준 모델을 압도한다.

ABSTRACT

Visual target navigation is a critical capability for autonomous robots operating in unknown environments, particularly in human-robot interaction scenarios. While classical and learning-based methods have shown promise, most existing approaches lack common-sense reasoning and are typically designed for single-robot settings, leading to reduced efficiency and robustness in complex environments. To address these limitations, we introduce Co-NavGPT, a novel framework that integrates a Vision Language Model (VLM) as a global planner to enable common-sense multi-robot visual target navigation. Co-NavGPT aggregates sub-maps from multiple robots with diverse viewpoints into a unified global map, encoding robot states and frontier regions. The VLM uses this information to assign frontiers across the robots, facilitating coordinated and efficient exploration. Experiments on the Habitat-Matterport 3D (HM3D) demonstrate that Co-NavGPT outperforms existing baselines in terms of success rate and navigation efficiency, without requiring task-specific training. Ablation studies further confirm the importance of semantic priors from the VLM. We also validate the framework in real-world scenarios using quadrupedal robots. Supplementary video and code are available at: https://sites.google.com/view/co-navgpt2.

연구 동기 및 목표

  • 복잡한 환경에서 단일 로봇의 시각적 목표 탐색의 비효율성과 낮은 내성적 안정성을 해결하기 위해.
  • 엔드 투 엔드 학습 대신 LLM 기반 추론으로 다중 로봇 협업 정책의 계산 비용을 줄이기 위해.
  • 프롬프트 기반 시나리오 이해를 통해 LLM을 글로벌 플래너로 활용하여, 미지의 환경에서 효율적이고 협업적인 탐색을 가능하게 하기 위해.
  • 학습 없이도 LLM이 제로샷 다중 로봇 협업 탐색에 적합한지 평가하기 위해.

제안 방법

  • 프레임워크는 의미 맵과 로봇 상태를 자연어 프롬프트로 인코딩하여 LLM의 시나리오 이해 능력을 향상시킨다.
  • LLM은 맥락적 단서, 목표 물체, 공간적 레이아웃을 바탕으로 각 로봇에 대해 탐색하지 않은 프론티어를 할당하는 글로벌 플래너로 기능한다.
  • 프론티어 선택은 물체 의미, 구조적 레이아웃, 로봇 위치, 목표 기술 등을 포함한 프롬프트에 의해 유도된다.
  • 각 로봇은 LLM 기반 할당 후 동일한 로컬 플래닝 알고리즘을 사용하여 할당된 프론티어로 향해 행동을 실행한다.
  • 환경 특징은 의미 분할을 통해 추출되어 LLM 입력을 위한 텍스트 프롬프트에 통합된다.
  • 시스템은 제로샷 방식으로 작동하며, 최적화나 강화 학습 없이도 작동한다.

실험 결과

연구 질문

  • RQ1LLM은 학습 과정 없이도 다중 로봇 협업 시각 탐색의 효과적인 글로벌 플래너로 기능할 수 있는가?
  • RQ2환경 특징의 프롬프트 기반 인코딩이 LLM의 탐색 및 목표 탐색에 대한 추론 능력을 어떻게 향상시키는가?
  • RQ3전통적인 히우리스틱 또는 학습된 정책과 비교해 LLM을 사용한 프론티어 할당이 성능에 얼마나 기여하는가?
  • RQ4의미 분할의 정확도가 Co-NavGPT 프레임워크의 전체 탐색 성공률에 미치는 영향은 무엇인가?

주요 결과

  • Co-NavGPT는 HM3D 벤치마크에서 66.1%의 성공률을 기록하여, 그레디(Greedy, 61.1%), 코스트-유티리티(Cost-Utility, 62.5%), 랜덤 샘플링(Random Sampling, 63.6%)를 포함한 모든 기준 모델을 크게 앞서며 성능을 뛰어넘었다.
  • 시스템은 평균 목표 도달 시간(DTG)을 1.831로 낮추어 모든 방법 중에서 가장 낮은 수준을 기록하여 탐색 효율성이 뛰어나다는 것을 보여준다.
  • 단일 로봇 버전인 Single-NavGPT는 단지 53.9%의 성공률을 기록하여 다중 로봇 협업이 성능 향상에 기여한다는 점을 입증한다.
  • 정답 의미 분할(Ground-truth segmentation, Co-NavGPT GT-Seg)을 사용할 경우 성공률이 75.7%로 상승하여 정확한 의미 맵핑의 핵심적 역할을 확인한다.
  • 아블레이션 스터디 결과 의미 분할이 핵심적 블로킹 요소임을 확인하였으며, 예측된 의미 분할으로 대체할 경우 성능이 크게 하락한다.
  • 모델는 뛰어난 일반화 능력을 보이며, 최적화나 강화 학습 없이도 높은 성능을 기록하여 LLM이 제로샷 다중 로봇 계획에 실현 가능함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.