[논문 리뷰] Bridging the Domain Gap: Self-Supervised 3D Scene Understanding with Foundation Models
Bridge3D는 3D 포인트 클라우드와 텍스트/이미지 모odalities 사이의 도메인 갭을 해소하기 위해 기초 모델을 활용하는 자기지도 학습 기반 3D 장면 이해 프레임워크를 제안한다. 기초 모델이 생성한 의미적 마스크와 캡션을 통해 장면 수준 및 개체 수준의 지식 정복을 가능하게 하여, 3D 객체 검출 및 의미 분할 성능을 크게 향상시켰으며, ScanNet에서 기준 모델 대비 6.3%의 절대적 성능 향상을 달성했다.
Foundation models have achieved remarkable results in 2D and language tasks like image segmentation, object detection, and visual-language understanding. However, their potential to enrich 3D scene representation learning is largely untapped due to the existence of the domain gap. In this work, we propose an innovative methodology called Bridge3D to address this gap by pre-training 3D models using features, semantic masks, and captions sourced from foundation models. Specifically, our method employs semantic masks from foundation models to guide the masking and reconstruction process for the masked autoencoder, enabling more focused attention on foreground representations. Moreover, we bridge the 3D-text gap at the scene level using image captioning foundation models, thereby facilitating scene-level knowledge distillation. We further extend this bridging effort by introducing an innovative object-level knowledge distillation method that harnesses highly accurate object-level masks and semantic text data from foundation models. Our methodology significantly surpasses the performance of existing state-of-the-art methods in 3D object detection and semantic segmentation tasks. For instance, on the ScanNet dataset, Bridge3D improves the baseline by a notable margin of 6.3%. Code will be available at: https://github.com/Zhimin-C/Bridge3D
연구 동기 및 목표
- 자기지도 학습 기반 3D 표현 학습에서 3D 포인트 클라우드와 텍스트/이미지 기초 모델 간의 도메인 갭을 해소한다.
- 대규모 3D-텍스트 쌍 데이터셋의 부족을 보완하기 위해 이미지 캡션 기초 모델을 활용해 합성된 3D-장면 프롬프트를 생성한다.
- 기초 모델에서 유래한 높은 정확도의 개체 수준 마스크 및 의미 텍스트 데이터를 활용해 3D 표현 학습을 향상시킨다.
- 기초 모델 유도 마스크 및 패치 제거 전략을 통해 3D 마스크된 오토인코더 학습을 개선하여 전경 객체 특징에 집중한다.
- 기초 모델에서 유래한 3D, 2D, 텍스트 특징를 융합함으로써 장면 수준 및 개체 수준의 다중 수준 지식 정복을 가능하게 한다.
제안 방법
- 이미지 캡션 기초 모델(예: BLIP)을 활용해 3D 장면에 대한 자연어 기술을 생성함으로써 장면 수준 지식 정복를 위한 3D-텍스트 프롬프트를 생성한다.
- 개체 세분화 모델(Grounding DINO 및 SAM)을 활용해 기초 모델 출력에서 정밀한 개체 수준 마스크를 생성함으로써 개체 수준 지식 정복을 가능하게 한다.
- 기초 모델의 의미 마스크에 기반한 새로운 마스크 및 패치 제거 전략을 설계하여, 마스크된 오토인코더가 전경 객체에 집중하고 배경 간섭을 줄이도록 유도한다.
- 기초 모델에서 유래한 특징, 의미 마스크, 캡션을 자기지도 학습 방식으로 3D 트랜스포머 백본에 전이함으로써 다중 모odal 지식 정복을 수행한다.
- 3D, 2D, 텍스트 특징를 융합하여 장면 수준 및 개체 수준의 정복을 통합된 3D 사전학습 파이프라인에 통합함으로써 특징 품질 향상 및 최종 성능 향상을 달성한다.
- 표준 및 최신 기술 수준의 3D 검출 네트워크(예: CAGroup3D)에 프레임워크를 적용하여 이식 가능성과 성능 향상을 입증한다.
실험 결과
연구 질문
- RQ1기초 모델을 효과적으로 활용하여 자기지도 학습 기반 3D 장면 표현 학습을 위한 고품질의 3D-텍스트 및 3D-2D 정렬을 생성할 수 있는가?
- RQ2기초 모델 유도 마스크는 무작위 마스크 대비 3D 마스크된 오토인코더에서 전경 표현 학습을 얼마나 향상시키는가?
- RQ3기초 모델에서 유래한 장면 수준 및 개체 수준의 지식 정복는 3D 객체 검출 및 의미 분할 성능을 얼마나 향상시키는가?
- RQ4CLIP, SAM, BLIP 등의 다수 기초 모델을 통합 사용할 경우, 개별 모델 단독 사용 대비 3D 자기지도 학습에서 어떤 성능 차이를 보이는가?
- RQ5제안된 프레임워크는 아키텍처 수정 없이 기존 최신 기술 수준의 3D 검출 아키텍처에 효과적으로 적용될 수 있는가?
주요 결과
- Bridge3D는 기준 모델인 Point-MAE 대비 ScanNetV2 데이터셋에서 평균 정밀도(mAP)를 6.3% 절대적으로 향상시켰으며, AP@25는 65.3%, AP@50는 44.2%를 기록했다.
- S3DIS 데이터셋에서 Bridge3D는 mIoU를 70.2%로 향상시키고, mAcc를 76.1%로 끌어올려 이전의 자기지도 학습 방법 및 Point-MAE 기준 모델을 모두 능가했다.
- 제거 실험 결과, 특징, 의미 마스크, 캡션의 세 가지 모odal 모두 성능 향상에 기여하며, 전체 모달 조합이 가장 우수한 성능을 기록함을 확인했다.
- 기초 모델이 생성한 마스크는 전통적 방법(예: MaskCLIP + 슈퍼픽셀)보다 뛰어난 정확도와 의미적 풍부함을 보이며, 개체 수준 정복에 유리함을 입증했다.
- SOTA 모델인 CAGroup3D에 적용했을 때, Bridge3D 사전학습은 ScanNet에서 AP@25를 75.1%에서 76.3%로, SUN RGB-D에서 66.8%에서 68.7%로 향상시켜 일반화 및 이식 가능성의 우수성을 입증했다.
- 모달 변동에 대해 강력한 내성성을 보이며, 일부 모달을 제거하더라도 높은 성능 유지함을 통해 유연하고 견고한 설계임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.