[논문 리뷰] CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory
CLIP-Fields는 웹에서 사전 훈련된 시각-언어 모델인 CLIP와 Detic을 사용하여 공간적 위치에서 의미 임베딩을 학습하는 약한 감독을 받는 암묵적 3D 환경 표현 방식을 제안한다. 이는 최소한의 인간 레이블링으로도 제로샷 의미 분할, 인스턴스 식별 및 실세계 환경에서의 의미 기반 탐색을 가능하게 하며, HM3D에서 적은 데이터로도 뛰어난 소수 샘플 성능을 달성하고 실물 로봇의 자연어 쿼리 기반 탐색을 가능하게 한다.
We propose CLIP-Fields, an implicit scene model that can be used for a variety of tasks, such as segmentation, instance identification, semantic search over space, and view localization. CLIP-Fields learns a mapping from spatial locations to semantic embedding vectors. Importantly, we show that this mapping can be trained with supervision coming only from web-image and web-text trained models such as CLIP, Detic, and Sentence-BERT; and thus uses no direct human supervision. When compared to baselines like Mask-RCNN, our method outperforms on few-shot instance identification or semantic segmentation on the HM3D dataset with only a fraction of the examples. Finally, we show that using CLIP-Fields as a scene memory, robots can perform semantic navigation in real-world environments. Our code and demonstration videos are available here: https://mahis.life/clip-fields
연구 동기 및 목표
- 인간 레이블링 데이터셋에 의존하지 않고 확장 가능하고 오픈 어휘 기반의 3D 공간-의미 기억을 위한 로봇용 시스템 개발
- 웹 규모의 사전 훈련된 시각-언어 모델을 유일한 감독으로 사용하여 3D 환경에서 의미 이해와 탐색을 가능하게 하는 것
- CLIP와 Detic의 특징을 사용하여 대조 손실을 통해 암묵적 신경 장을 훈련시켜 제로샷 또는 소수 샘플 환경 이해를 가능하게 하는 것
- 학습된 3D 의미 임베딩 장을 질의하여 실세계 로봇 탐색을 자연어 쿼리로 수행할 수 있도록 하는 것
- 기초 시각-언어 모델의 품질이 pre-training 단계에서 사용된 모델의 품질과 성능 간 상관관계를 보여주는 것
제안 방법
- CLIP-Fields는 3D 공간 좌표를 의미 임베딩 벡터로 매핑하는 신경 암묵 함수 $ g: \mathbb{R}^3 \to \mathbb{R}^d $ 를 정의한다.
- 유사한 특징이 동일한 물체 또는 환경 영역에 해당하는 다수의 RGB-D 뷰에서 공간적 위치에 대해 유사한 특징을 유도하도록 대조 손실을 사용하여 모델을 훈련시킨다.
- 사전 훈련된 모델에서 특징을 추출한다: CLIP는 시각-언어 정렬을 위해, Detic은 물체 검출을 위해, Sentence-BERT는 텍스트 쿼리를 위해 사용된다.
- 다중 뷰 RGB-D 데이터와 추정된 카메라 자세를 활용하여 인간의 명시적 레이블링 없이도 3D 임베딩 장을 감독한다.
- 추론 단계에서는 쿼리가 임베딩 벡터로 인코딩되고 코사인 유사도를 통해 CLIP-Fields 표현 내 가장 가까운 점과 매칭된다.
- 로봇은 쿼리 임베딩과 장에 저장된 특징 간의 일치도가 가장 높은 공간적 위치로 이동한다.
실험 결과
연구 질문
- RQ1사전 훈련된 시각-언어 모델을 활용하여 인간의 감독을 최소화한 3D 환경 표현을 학습할 수 있는가?
- RQ2CLIP-Fields는 레이블링 데이터에 대한 미세조정 없이도 소수 샘플 인스턴스 식별 및 의미 분할을 수행할 수 있는가?
- RQ3자연어 쿼리와 약한 감독을 받는 3D 임베딩 장만으로도 로봇이 의미 기반 탐색을 수행할 수 있는가?
- RQ4CLIP-Fields의 성능는 사용된 기초 시각-언어 모델의 품질에 따라 어떻게 달라지는가?
- RQ5CLIP-Fields는 실세계 환경에서 시각적 및 의미적 묘사가 포함된 오픈 어휘 쿼리를 지원할 수 있는가?
주요 결과
- CLIP-Fields는 HM3D 벤치마크에서 마스크-RCNN보다 소수 샘플 인스턴스 식별 및 의미 분할 과제에서 더 높은 성능을 보이며, 훈련 데이터의 일부분만으로도 이를 달성한다.
- 이 방법은 주방 및 도서관 환경에서 모두 성공적으로 자연어 쿼리 기반 실물 로봇 탐색을 가능하게 한다.
- 기초 시각 모델의 정확도가 높을수록 성능이 뚜렷하게 향상되며, 훈련 중에 잘못 분류된 물체는 탐색 실패로 이어진다.
- 단순한 철자 오류가 있는 경우에도 정확한 물체 검색이 가능하여 어휘 노이즈에 강건함을 입증한다.
- 의미적으로 유사한 개념을 혼동하는 경우가 있으며, 예를 들어 "내 손을 씻어줘" 또는 "내 빨래를 씻어줘"와 같은 쿼리에서 식기세척기로 오답을 유도할 수 있다. 이는 의미 해석의 불확실성에 기인한다.
- 시각적 쿼리는 의미적 유사성으로 인해 오해를 일으킬 수 있으나, 예를 들어 "빨간 플라스틱 밥그릇"처럼 더 구체적인 묘사일 경우 정확도가 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.