[논문 리뷰] Open-vocabulary Queryable Scene Representations for Real World Planning
이 논문은 CLIP 및 ViLD 시각-언어 모델을 사용하여 대규모 언어 모델(Large Language Model, LLM) 기반 계획자들이 실제 환경에 맞춰지도록 하는 오픈-보편어휘(open-vocabulary), 질의 가능한 장면 표현 방식인 NLMap을 제안한다. 자연어 질의를 통해 물체의 존재 여부와 위치를 파악함으로써 NLMap은 장기적인 로봇 계획 성능을 향상시키며, 55개의 실제 환경 작업에서 61.8%의 성공률을 기록했다. 이 중 35개 작업은 이전 최고 성능의 계획자들이 오픈-보편어휘 장면 기반 기반 없이 수행할 수 없었던 작업이었다.
Large language models (LLMs) have unlocked new capabilities of task planning from human instructions. However, prior attempts to apply LLMs to real-world robotic tasks are limited by the lack of grounding in the surrounding scene. In this paper, we develop NLMap, an open-vocabulary and queryable scene representation to address this problem. NLMap serves as a framework to gather and integrate contextual information into LLM planners, allowing them to see and query available objects in the scene before generating a context-conditioned plan. NLMap first establishes a natural language queryable scene representation with Visual Language models (VLMs). An LLM based object proposal module parses instructions and proposes involved objects to query the scene representation for object availability and location. An LLM planner then plans with such information about the scene. NLMap allows robots to operate without a fixed list of objects nor executable options, enabling real robot operation unachievable by previous methods. Project website: https://nlmap-saycan.github.io
연구 동기 및 목표
- 고정된 물체 목록에 의존하지 않고도 동적인 오픈-보편어휘 환경에서 실세계 로봇 작업 계획을 가능하게 하기 위해.
- 이전 LLM 계획자들이 물리적 장면에 기반하지 않으며, 새로운 또는 오픈-보편어휘 물체 질의를 처리할 수 없는 한계를 해결하기 위해.
- 물체 가용성과 위치에 대한 자연어 질의를 지원하는 유연하고 지속적인 장면 표현을 개발하기 위해.
- 이 표현 방식을 계획 프레임워크(SayCan)와 통합하여 자연어 지시어로부터 맥락 인식 가능하고 실행 가능한 계획을 가능하게 하기 위해.
- 비정형 환경에서 실제 로봇을 대상으로 시스템을 평가하여 이전 최고 수준의 방법을 뛰어넘는 능력을 입증하기 위해.
제안 방법
- NLMap는 클래스 무관한 경계 상자들을 사용하여 물체 제안의 특징 포인트 클라우드를 구성하며, 각각 512차원의 CLIP 및 ViLD 시각 임베딩과 연관시킨다.
- 질의된 텍스트와 장면 임베딩 간의 텍스트-시각 특징 정렬 점수를 계산하여 자연어 질의를 가능하게 하며, 이를 히트맵으로 시각화한다.
- 다중 시야 융합 전략을 통해 여러 카메라 시야의 검출 결과를 융합하여 노이즈를 감소시키고 검출 신뢰도를 향상시킨다.
- LLM 기반의 물체 제안 모듈이 지시어를 분석하여 NLMap 표현에서 질의할 관련 물체를 식별한다.
- LLM 계획자는 질의 결과(물체 존재 여부 및 위치)를 바탕으로 맥락 조건에 맞는 실행 가능한 동작 계획을 생성한다.
- 시스템은 실세계 로봇에 배포되었으며, 인식, 물체 제안, 계획에 대해 사전 훈련된 제로샷 모델을 사용한다.
실험 결과
연구 질문
- RQ1실세계 환경에서 물체 존재 여부와 위치에 대한 오픈-보편어휘, 자연어 질의를 지원하는 장면 표현을 구축할 수 있는가?
- RQ2사전에 정의된 물체 목록이나 하드코딩된 물체 위치에 의존하지 않고 LLM 기반 계획자가 실세계 장면에 효과적으로 기반을 두는 방법은 무엇인가?
- RQ3CLIP 및 ViLD 임베딩을 다중 시야 융합과 조합함으로써 실세계 환경에서 오픈-보편어휘 물체 검색 정확도에 어떤 영향을 미치는가?
- RQ4NLMap이 장면 기반 기반 없이 이전에 수행이 불가능했던 새로운 로봇 작업을 얼마나 많이 가능하게 하는가?
- RQ5NLMap을 SayCan과 통합함으로써 장기적이고 지시어 기반의 로봇 계획에서 성공률은 얼마나 향상되는가?
주요 결과
- NLMap는 Scene 1에서 82%의 인식 성공률, Scene 2에서 64%의 성공률를 기록하였으며, 개별 CLIP 또는 ViLD 임베딩보다 뚜렷이 뛰어난 성능을 보였다.
- 최대 앙상블과 다중 시야 융합의 조합은 Scene 2에서 질의 성공률을 17% 향상시켜, 다중 시각 특징과 다중 시야 융합의 효과를 입증했다.
- LLM 계획자는 양성 테스트 케이스에서 85%의 성공률, 부정성 테스트 케이스에서 60%의 성공률를 기록하여, 정확한 물체 기반 기반의 맥락 인식 계획에서 뛰어난 성능을 보였다.
- 55개의 실제 환경 작업 중 35개는 이전 최고 수준의 계획자들에게는 수행이 불가능했으며, 이는 NLMap이 새로운 작업 유형을 가능하게 한다는 점을 강조한다.
- 주방 환경에서 55개의 실제 환경 작업에서 시스템은 61.8%의 성공률을 기록했으며, 실행 궤적은 CLIP 특징을 통해 사인을 정확히 인식하는 등 올바른 물체 인식을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.