[논문 리뷰] CLIP2Scene: Towards Label-efficient 3D Scene Understanding by CLIP
CLIP2Scene는 시맨틱 기반의 다중모달 대비 학습을 통해 CLIP의 시각-언어 사전 학습 지식을 3차원 포인트 클라우드 분할에 전이하는 새로운 프레임워크이다. 이미지와 포인트 클라우드 특징 간의 공간-시간 일관성을 강제하고, CLIP의 텍스트 시맨틱을 이용해 양성/음성 샘플을 선택함으로써, 레이블이 없는 및 소수의 샘플을 사용하는 3D 시맨틱 분할에서 최신 기술 수준의 성능을 달성한다. 레이블이 전혀 없는 조건에서 ScanNet에서 25.08%의 mIoU를 기록하였다.
Contrastive Language-Image Pre-training (CLIP) achieves promising results in 2D zero-shot and few-shot learning. Despite the impressive performance in 2D, applying CLIP to help the learning in 3D scene understanding has yet to be explored. In this paper, we make the first attempt to investigate how CLIP knowledge benefits 3D scene understanding. We propose CLIP2Scene, a simple yet effective framework that transfers CLIP knowledge from 2D image-text pre-trained models to a 3D point cloud network. We show that the pre-trained 3D network yields impressive performance on various downstream tasks, i.e., annotation-free and fine-tuning with labelled data for semantic segmentation. Specifically, built upon CLIP, we design a Semantic-driven Cross-modal Contrastive Learning framework that pre-trains a 3D network via semantic and spatial-temporal consistency regularization. For the former, we first leverage CLIP's text semantics to select the positive and negative point samples and then employ the contrastive loss to train the 3D network. In terms of the latter, we force the consistency between the temporally coherent point cloud features and their corresponding image features. We conduct experiments on SemanticKITTI, nuScenes, and ScanNet. For the first time, our pre-trained network achieves annotation-free 3D semantic segmentation with 20.8% and 25.08% mIoU on nuScenes and ScanNet, respectively. When fine-tuned with 1% or 100% labelled data, our method significantly outperforms other self-supervised methods, with improvements of 8% and 1% mIoU, respectively. Furthermore, we demonstrate the generalizability for handling cross-domain datasets. Code is publicly available https://github.com/runnanchen/CLIP2Scene.
연구 동기 및 목표
- CLIP의 사전 학습된 시각-언어 지식이 3차원 장면 이해에 어떻게 기여할 수 있는지 탐구하며, 특히 비용이 많이 드는 3차원 레이블에 대한 의존도를 줄이는 데 목적이 있다.
- 포인트 클라우드 샘플링 시 시맨틱 모호성으로 인해 잘못 정의된 음성 쌍으로 인해 발생하는 다중모달 자기지도 학습의 최적화 갈등 문제를 해결한다.
- 다중 스위프트 LiDAR 데이터의 시간적 일관성을 활용하여 이미지와 포인트 클라우드 특징 간의 시간에 걸친 일관성을 강제함으로써 특징 표현의 강건성을 향상시킨다.
- 어떤 레이블이 없는 훈련 데이터가 필요 없이 효과적인 소수의 샘플 및 제로샷 3D 시맨틱 분할을 가능하게 한다.
- 한 데이터셋에서 사전 학습하고 다른 데이터셋에서 미세조정하는 방식으로 도메인 간 일반화 능력을 입증한다. 예를 들어, nuScenes에서 사전 학습하고 SemanticKITTI에서 미세조정하는 것.
제안 방법
- 시맨틱 기반의 다중모달 대비 학습 프레임워크를 제안하며, CLIP의 텍스트 임베딩을 활용해 양성 및 음성 포인트 샘플을 선택함으로써 대비 학습의 최적화 갈등을 감소시킨다.
- 시맨틱 일관성 정규화를 도입하여, CLIP의 텍스트 임베딩을 사용해 시맨틱적으로 일관된 포인트 쌍을 정의하고, 대비 손실에 활용함으로써 표현 품질을 향상시킨다.
- 공간-시간 일관성 정규화를 구현하여, 시간적으로 일관된 포인트 클라우드 특징과 그에 대응하는 이미지 격자 특징 간의 특징 일관성을 강제함으로써, 조건이 불완전한 캘리브레이션 상황에서도 성능을 유지한다.
- 픽셀-포인트 매핑을 격자-격자 대응으로 완화함으로써 캘리브레이션 오차를 처리하고 다중모달 정렬의 강건성을 향상시킨다.
- 훈련 중에 이미지 및 포인트 클라우드 특징 간에 스위치 가능한 감독 메커니즘을 도입하여 오류 전파를 줄이고 일반화 성능을 향상시킨다.
- 수동으로 작성된 프롬프트에서 클래스 임베딩을 생성할 수 있도록 CLIP의 텍스트 인코더를 변형하여, 미세조정 없이도 제로샷 추론을 가능하게 한다.
실험 결과
연구 질문
- RQ1CLIP의 사전 학습된 시각-언어 표현이 3차원 포인트 클라우드 시맨틱 분할에 효과적으로 전이될 수 있는가? 특히 3차원 레이블이 전혀 필요 없이 성능 향상을 이룰 수 있는가?
- RQ2CLIP의 텍스트 시맨틱을 어떻게 활용하여 이미지와 포인트 클라우드 간의 다중모달 대비 학습에서 발생하는 최적화 갈등을 줄일 수 있는가?
- RQ3다중 스위프트 LiDAR 데이터의 시간적 일관성을 CLIP 특징과 결합할 경우, 3차원 표현 학습에 얼마나 기여하는가?
- RQ4제안된 방법이 도메인 간 일반화에 효과적인가? 예를 들어, nuScenes에서 사전 학습하고 SemanticKITTI에서 평가하는 경우, 도메인 특화 미세조정 없이도 성능이 우수한가?
- RQ5기존 자기지도 학습 방법과 비교해 볼 때, 특히 레이블이 1% 밖에 없는 상황에서 제안된 프레임워크는 어떻게 성능을 내는가?
주요 결과
- CLIP2Scene는 ScanNet에서 annotation-free 3D 시맨틱 분할 시 25.08%의 mIoU를 기록했으며, nuScenes에서는 20.8%의 mIoU를 달성하여, CLIP를 사용한 첫 번째 성공적인 제로샷 3D 분할을 이룩했다.
- nuScenes에서 레이블이 1% 밖에 없는 조건에서 미세조정을 수행한 결과, 최신 기술 수준의 SLidR보다 mIoU가 8.1% 향상되어 소수의 샘플에서의 강력한 일반화 능력을 입증했다.
- 100% 레이블이 있는 조건에서도 CLIP2Scene는 SLidR보다 mIoU가 1.1% 향상되어, 완전히 지도 학습 설정에서도 일관된 성능 향상을 보였다.
- 메서드는 도메인 간 일반화에 효과적이며, nuScenes에서 사전 학습하고 SemanticKITTI에서 미세조정한 결과, 최신 기술 수준의 자기지도 학습 방법보다 뛰어난 성능을 기록했다.
- 제거 분석 결과, 시맨틱 일관성 정규화와 공간-시간 정규화 모두 필수적임을 확인했으며, 각 성분이 최종 성능 향상에 크게 기여했다.
- 스위치 가능한 감독 메커니즘이 오류 전파를 줄이고 특징 학습을 향상시켜, 모든 평가 프로토콜에서 성능 향상이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.