Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP2Point: Transfer CLIP to Point Cloud Classification with Image-Depth Pre-training

Tianyu Huang, Bowen Dong|arXiv (Cornell University)|2022. 10. 03.
Advanced Vision and Imaging인용 수 14
한 줄 요약

CLIP2Point는 ShapeNet의 52,460개의 렌더링된 이미지-깊이 쌍을 기반으로 대조학습을 통해 깊이 인코더를 훈련시켜 CLIP의 시각-언어 지식을 3D 포인트 클라우드 분류에 전이하는 새로운 이미지-깊이 사전학습 방법을 제안한다. Gated Dual-Path Adapter를 사용하여 CLIP와 CLIP2Point의 특징을 효율적으로 융합함으로써 제로샷, 패기샷, 완전 지도 학습 설정에서 최신 기술 성능을 달성한다.

ABSTRACT

Pre-training across 3D vision and language remains under development because of limited training data. Recent works attempt to transfer vision-language pre-training models to 3D vision. PointCLIP converts point cloud data to multi-view depth maps, adopting CLIP for shape classification. However, its performance is restricted by the domain gap between rendered depth maps and images, as well as the diversity of depth distributions. To address this issue, we propose CLIP2Point, an image-depth pre-training method by contrastive learning to transfer CLIP to the 3D domain, and adapt it to point cloud classification. We introduce a new depth rendering setting that forms a better visual effect, and then render 52,460 pairs of images and depth maps from ShapeNet for pre-training. The pre-training scheme of CLIP2Point combines cross-modality learning to enforce the depth features for capturing expressive visual and textual features and intra-modality learning to enhance the invariance of depth aggregation. Additionally, we propose a novel Dual-Path Adapter (DPA) module, i.e., a dual-path structure with simplified adapters for few-shot learning. The dual-path structure allows the joint use of CLIP and CLIP2Point, and the simplified adapter can well fit few-shot tasks without post-search. Experimental results show that CLIP2Point is effective in transferring CLIP knowledge to 3D vision. Our CLIP2Point outperforms PointCLIP and other self-supervised 3D networks, achieving state-of-the-art results on zero-shot and few-shot classification.

연구 동기 및 목표

  • CLIP의 이미지 사전학습과 3D 포인트 클라우드 작업 사이의 도메인 갭을 해소하기 위해, 3D-언어 사전학습 데이터가 제한된 문제를 해결한다.
  • 깊이 맵을 통해 CLIP의 시각-언어 지식을 3D로 적응시켜 제로샷 및 패기샷 포인트 클라우드 분류 성능을 향상시킨다.
  • 깊이 특징을 CLIP의 시각적 특징과 정렬하면서도 다중 시점 변화에 대해 불변성을 유지하는 사전학습 방식을 개발한다.
  • 하류 3D 작업을 위한 CLIP와 CLIP2Point 표현을 융합하는 효율적인 어댑터 모듈을 설계한다.

제안 방법

  • ShapeNet 3D 모델에서 렌더링된 52,460개의 다중 시점 이미지-깊이 쌍을 기반으로 대조학습을 통해 깊이 인코더를 사전학습한다.
  • 교차 모odal 대조학습을 적용하여 깊이 특징을 CLIP의 이미지 특징과 정렬함으로써 도메인 갭을 감소시킨다.
  • 깊이 맵에 대해 내부 모달 대조학습을 적용하여 시점 변화에 대한 내성적 불변성을 향상시키고 특징 일관성을 개선한다.
  • CLIP의 훈련 분포에 더 가까운, 최소 깊이 값과 팽창률을 사용하는 새로운 깊이 렌더링 설정을 도입하여 시각적으로 현실적인 깊이 맵을 생성한다.
  • CLIP와 CLIP2Point 각각의 병렬 인코더를 갖는 Gated Dual-Path Adapter(GDPA)를 제안하며, 각 인코더는 전역 시야 집약기와 학습 가능한 게이팅 융합을 포함한다.
  • 고정된 CLIP 이미지 인코더를 사용하고 사전학습 기간 동안 깊이 인코더만 미세조정함으로써 하류 3D 작업으로의 지식 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1이미지-깊이 쌍에서의 대조학습이 CLIP의 시각-언어 지식을 3D 포인트 클라우드 분류로 효과적으로 전이할 수 있는가?
  • RQ2깊이 렌더링 설정의 선택이 하류 3D 분류 작업 성능에 어떤 영향을 미치는가?
  • RQ3게이팅 융합을 갖는 이중 경로 어댑터가 CLIP와 CLIP2Point 특징을 융합함으로써 특징 표현을 얼마나 향상시킬 수 있는가?
  • RQ4ShapeNet에서의 합성 깊이 맵에 대한 사전학습이 실제 세계 3D 비전 벤치마크로 일반화되는가?
  • RQ5CLIP2Point는 제로샷, 패기샷, 완전 지도 학습 설정에서 기존의 3D 전이 학습 및 사전학습 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • CLIP2Point는 제로샷, 패기샷, 완전 지도 학습 설정에서 ModelNet10, ModelNet40, ScanObjectNN에서 최신 기술 성능을 달성한다.
  • 최소 깊이 값 렌더링 설정은 ModelNet10에서 24.87%의 제로샷 정확도를 기록하여 가중 깊이 설정(16.86%)보다 8个百分点 이상 뛰어나다.
  • 깊이 렌더링에서 팽창률을 2로 설정할 경우 최적의 균형을 이룹니다. 이 경우 29.71%의 제로샷 정확도를 기록하며, 더 높은 비율(R=4)은 블러링으로 인해 성능이 저하된다.
  • Gated Dual-Path Adapter는 ModelNet10에서 패기샷 정확도를 89.79%로 향상시켜 단일 경로 기반 베이스라인 및 아블레이션 변형보다 뚜렷이 뛰어나다.
  • 특징 시각화 결과는 CLIP2Point로 사전학습을 수행할 경우 기준 방법 대비 특징 공간에서 더 나은 클래스 분리가 이루어짐을 확인한다.
  • 사전학습된 깊이 인코더와 CLIP 인코더를 갖는 이중 경로 구조는 CLIP만으로 초기화한 경우(87.20% 대비 87.46%)보다 높은 정확도를 달성하여 상호 보완적 지식 융합의 효과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.