Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training

Xiaoyang Wu, Zhuotao Tian|arXiv (Cornell University)|2023. 08. 18.
3D Shape Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 Point Prompt Training (PPT)을 제안하며, 음성 전이를 완화하기 위해 프롬프트 기반 정규화와 언어 유도 캬테고리 일치 기법을 도입함으로써 다수의 데이터셋 간 상호보완적 훈련을 가능하게 하는 새로운 프레임워크를 제시한다. PPT는 단일 공유 가중치 모델을 사용하여 다양한 실내 및 실외 3D 벤치마크에서 최신 기술 수준의 성능을 달성하며, 단일 데이터셋 또는 단순한 다중 데이터셋 훈련 방법에 비해 일반화 능력과 표현 품질을 크게 향상시킨다.

ABSTRACT

The rapid advancement of deep learning models often attributes to their ability to leverage massive training data. In contrast, such privilege has not yet fully benefited 3D deep learning, mainly due to the limited availability of large-scale 3D datasets. Merging multiple available data sources and letting them collaboratively train a single model is a potential solution. However, due to the large domain gap between 3D point cloud datasets, such mixed supervision could adversely affect the model's performance and lead to degenerated performance (i.e., negative transfer) compared to single-dataset training. In view of this challenge, we introduce Point Prompt Training (PPT), a novel framework for multi-dataset synergistic learning in the context of 3D representation learning that supports multiple pre-training paradigms. Based on this framework, we propose Prompt-driven Normalization, which adapts the model to different datasets with domain-specific prompts and Language-guided Categorical Alignment that decently unifies the multiple-dataset label spaces by leveraging the relationship between label text. Extensive experiments verify that PPT can overcome the negative transfer associated with synergistic learning and produce generalizable representations. Notably, it achieves state-of-the-art performance on each dataset using a single weight-shared model with supervised multi-dataset training. Moreover, when served as a pre-training framework, it outperforms other pre-training approaches regarding representation quality and attains remarkable state-of-the-art performance across over ten diverse downstream tasks spanning both indoor and outdoor 3D scenarios.

연구 동기 및 목표

  • 점군 데이터셋 간 큰 도메인 갭으로 인한 다중 데이터셋 3D 표현 학습에서의 음성 전이 문제를 해결하기 위해.
  • 다양한 3D 데이터셋 간의 레이블 공간을 통합하고 모델을 도메인 특화 분포에 적응시킴으로써 효과적인 다중 데이터셋 상호보완적 훈련을 가능하게 하기 위해.
  • 감독 학습 및 자기지도 학습 모두에 호환되는 통합형 사전 훈련 프레임워크를 개발하기 위해.
  • 클래스 레이블 간 텍스트 관계와 도메인 특화 프롬프트 적응을 활용하여 일반화 능력과 표현 품질을 향상시키기 위해.

제안 방법

  • 감독 학습 및 비감독 학습 모두를 지원하는 다중 데이터셋 3D 표현 학습을 위한 통합 프레임워크인 Point Prompt Training (PPT)을 도입한다.
  • 모델의 정규화 레이어를 도메인 특화 프롬프트로 적응시켜 도메인 갭 영향을 줄이는 프롬프트 기반 정규화를 제안한다.
  • 클래스 이름의 텍스트 임베딩을 사용해 레이블 공간을 통합함으로써 다수의 데이터셋 레이블 공간을 일치시키는 언어 유도 캬테고리 일치(LCA)를 도입한다.
  • 공유 가중치 모델을 다수의 데이터셋에서 훈련하며, 프롬프트 어댑터와 LCA를 통해 성능 저하 없이 도메인 일반화를 달성한다.
  • 대비 학습과 교차 어텐션 메커니즘을 활용해 통합 잠재 공간 내에서 점군 특징과 카테고리-텍스트 임베딩을 일치시킨다.
  • 포함된 데이터셋에서의 직접 평가와 파인튜닝을 통한 다운스트림 작업으로의 전이 학습을 모두 지원한다.

실험 결과

연구 질문

  • RQ13D 표현 학습에서 다수의 데이터셋을 함께 훈련할 때, 데이터셋 간 큰 도메인 갭으로 인한 음성 전이 문제를 극복할 수 있는가?
  • RQ23D 점군에서 도메인 특화 분포 이탈 문제를 공동 훈련 중 효과적으로 완화할 수 있는가?
  • RQ3단지 텍스트 기반 클래스 설명만을 사용하여 다양한 3D 데이터셋 간에 통합된 레이블 공간을 구축할 수 있는가?
  • RQ4다양한 데이터셋에서 훈련된 단일 공유 가중치 모델이 단일 데이터셋 기반 모델에 비해 일반화 능력과 다운스트림 성능 측면에서 뛰어나게 되는가?
  • RQ5제안된 프레임워크가 다양한 실내 및 실외 3D 환경에서 우수한 사전 훈련 전략이 될 수 있는가?

주요 결과

  • PPT는 다수의 실내 데이터셋에서 훈련된 단일 공유 가중치 모델을 사용하여 ScanNet과 S3DIS에서 최신 기술 수준의 성능을 달성했으며, ScanNet 검증 세트에서 75.4% mIoU, 테스트 세트에서 77.5% mIoU를 기록했다.
  • 실외 벤치마크에서는 SemanticKITTI(88.34% mIoU), nuScenes(90.84% mIoU), Waymo(94.56% mIoU)에서 최신 기술 수준의 결과를 기록하여 다양한 도메인 간 강력한 일반화 능력을 입증했다.
  • 음성 전이로 인한 성능 저하를 완화하기 위해 도메인 프롬프트 적응과 레이블 공간 일치를 통해 단순 공동 훈련보다 성능이 뛰어나다.
  • 절단 실험을 통해 공유 도메인 프롬프트가 일반화 능력을 향상시키는 반면, 블록 단위 독립형 프롬프트는 과적합과 성능 저하를 유발한다는 것이 확인되었다.
  • 언어 유도 캬테고리 일치(LCA)는 단일 데이터셋 훈련에서 효과적인 예측 헤드 역할을 하며, SpUNet-S에서 mIoU를 73.4에서 74.2로 향상시켰다.
  • 백본을 확장함으로써 PPT는 과적합을 줄이고 성능을 향상시켰으며, SpUNet-L은 S3DIS에서 75.8% mIoU를 기록하여 PPT 없이 사용하는 더 작은 모델보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.