[논문 리뷰] P2P: Tuning Pre-trained Image Models for Point Cloud Analysis with Point-to-Pixel Prompting
동결된 사전 학습된 2D 이미지 모델을 포인트 클라우드에 색상 이미지를 통해 변환하는 방법으로 3D 포인트 클라우드 작업에 활용하여 저파라미터 튜닝과 강한 성능을 달성하는 방법.
Nowadays, pre-training big models on large-scale datasets has become a crucial topic in deep learning. The pre-trained models with high representation ability and transferability achieve a great success and dominate many downstream tasks in natural language processing and 2D vision. However, it is non-trivial to promote such a pretraining-tuning paradigm to the 3D vision, given the limited training data that are relatively inconvenient to collect. In this paper, we provide a new perspective of leveraging pre-trained 2D knowledge in 3D domain to tackle this problem, tuning pre-trained image models with the novel Point-to-Pixel prompting for point cloud analysis at a minor parameter cost. Following the principle of prompting engineering, we transform point clouds into colorful images with geometry-preserved projection and geometry-aware coloring to adapt to pre-trained image models, whose weights are kept frozen during the end-to-end optimization of point cloud analysis tasks. We conduct extensive experiments to demonstrate that cooperating with our proposed Point-to-Pixel Prompting, better pre-trained image model will lead to consistently better performance in 3D vision. Enjoying prosperous development from image pre-training field, our method attains 89.3% accuracy on the hardest setting of ScanObjectNN, surpassing conventional point cloud models with much fewer trainable parameters. Our framework also exhibits very competitive performance on ModelNet classification and ShapeNet Part Segmentation. Code is available at https://github.com/wangzy22/P2P.
연구 동기 및 목표
- 3D 포인트 클라우드 사전 학습에서 데이터 부족 문제를 2D 이미지 사전 학습의 지식 전이로 해결한다.
- 동결된 2D 모델에 호환되도록 포인트 클라우드를 색상화된 이미지로 변환하는 프롬프트 기반 파이프라인을 도입한다.
- 지오메트릭 정보를 보존하면서 최소한의 학습 가능한 파라미터로 엔드 투 엔드 최적화를 가능하게 한다.
제안 방법
- 가벼운 DGCNN으로 포인트 클라우드 기하를 인코딩하여 포인트별 특성을 얻는다.
- 기하 보존 프로젝션을 적용해 포인트 특성을 이미지 스타일 레이아웃으로 매핑하되 공간 정보를 유지한다.
- 기하에 기반한 색칠 모듈을 사용해 색상화된 이미지 I를 생성해 사전 학습된 이미지 모델에 제공한다.
- 색상 이미지 I를 고정된 사전 학습 이미지 모델(예: ViT, ConvNeXt)에 입력해 다운스트림 헤드를 위한 이미지 수준 특징을 추출한다.
- 2D 이미지 도메인에서 정의된 손실을 사용해 태스크별 헤드를 학습하고 필요시 결과를 3D로 되돌려 투영한다.
실험 결과
연구 질문
- RQ1사이클이 있는 포인트 클라우드를 색상화된 이미지로 변환함으로써 사전 학습된 2D 이미지 모델을 3D 포인트 클라우드 분석에 효과적으로 사용할 수 있는가?
- RQ2P2P 프레임워크에서 사전 학습 이미지 모델의 규모가 3D 포인트 클라우드 분류 성능에 어떤 영향을 미치는가?
- RQ3이미지 모델을 동결하는지 아니면 선택된 매개변수만 미세 조정하는지가 3D 성능 달성에 어떤 영향을 주는가?
- RQ4기하 보존 프로젝션이 세분화와 같은 정확한 다운스트림 작업을 지원할 만큼 충분한 3D 구조를 보존하는가?
- RQ52D에서의 서로 다른 사전 학습 전략(감독 학습 vs. 비지도 학습)이 P2P를 통해 3D 작업으로 어떻게 전이되는가?
주요 결과
- 동일한 사전 학습 이미지 모델의 규모를 확대하면 P2P에서 3D 분류 성능이 개선된다.
- P2P와 HorNet-L이 ImageNet-22k에서 사전 학습된 경우 ScanObjectNN에서 89.3%를 달성하여 전통적인 3D 사전 학습 기준선을 능가한다.
- P2P는 ModelNet40 분류 및 ShapeNetPart 분할에서 학습 가능한 파라미터가 훨씬 적음에도 경쟁력 있는 결과를 제공한다.
- 색상 이미지 프롬프트링(Point-to-Pixel)은 기하 특성만 사용하거나 특징에서 직접 패치 임베딩을 하는 것보다 더 효과적이다.
- 감독 학습 2D 사전 학습이 일반적으로 비지도 학습보다 3D 전이에 더 나은 경향을 보이나 DINO, MAE 같은 강력한 비지도 방법도 경쟁력이 있다.
- 연구에서 이미지 모델의 정규화 매개변수만 미세 조정하는 것이 2D 지식을 활용하면서 과적합을 피하는 데 우호적이라는 것을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.