Skip to main content
QUICK REVIEW

[논문 리뷰] CoDA: Collaborative Novel Box Discovery and Cross-modal Alignment for Open-vocabulary 3D Object Detection

Yang Cao, Yihan Zeng|arXiv (Cornell University)|2023. 10. 04.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 CoDA를 제안하며, 3D 기하학적 정보와 2D 시맨틱 사전 지식을 동시에 활용해 새로운 3D 객체 박스를 공동으로 탐지하고, 포인트 클라우드, 이미지, 텍스트 간의 다중모달 특징을 발견 기반 다중모달 정렬 모듈을 통해 정렬하는 통합 프레임워크를 제공한다. CoDA는 SUN-RGBD와 ScanNet에서 기존 최고의 방법 대비 mAP 80% 향상 달성.

ABSTRACT

Open-vocabulary 3D Object Detection (OV-3DDet) aims to detect objects from an arbitrary list of categories within a 3D scene, which remains seldom explored in the literature. There are primarily two fundamental problems in OV-3DDet, i.e., localizing and classifying novel objects. This paper aims at addressing the two problems simultaneously via a unified framework, under the condition of limited base categories. To localize novel 3D objects, we propose an effective 3D Novel Object Discovery strategy, which utilizes both the 3D box geometry priors and 2D semantic open-vocabulary priors to generate pseudo box labels of the novel objects. To classify novel object boxes, we further develop a cross-modal alignment module based on discovered novel boxes, to align feature spaces between 3D point cloud and image/text modalities. Specifically, the alignment process contains a class-agnostic and a class-discriminative alignment, incorporating not only the base objects with annotations but also the increasingly discovered novel objects, resulting in an iteratively enhanced alignment. The novel box discovery and crossmodal alignment are jointly learned to collaboratively benefit each other. The novel object discovery can directly impact the cross-modal alignment, while a better feature alignment can, in turn, boost the localization capability, leading to a unified OV-3DDet framework, named CoDA, for simultaneous novel object localization and classification. Extensive experiments on two challenging datasets (i.e., SUN-RGBD and ScanNet) demonstrate the effectiveness of our method and also show a significant mAP improvement upon the best-performing alternative method by 80%. Codes and pre-trained models are released on the project page.

연구 동기 및 목표

  • 학습 중에 볼 수 없었던 새로운 3D 객체 카테고리 검출에 도전하며, 기초 카테고리 애너테이션만 제한적으로 제공된 조건에서 해결.
  • 무한한 카테고리가 가능한 오픈 뷰포인트 환경에서 새로운 3D 객체의 국소화 및 분류에 대한 이중 과제 해결.
  • 학습 중에 3D 및 2D 사전 지식을 직접 활용해 외부 2D 오픈 뷰포인트 검출 모델에 의존하지 않고 새로운 객체 탐지를 학습.
  • 서로 다른 피드백을 주고받는 공동 학습 프레임워크 개발을 통해 새로운 객체 국소화 및 다중모달 특징 정렬을 동시에 향상.
  • 추론 시에 2D 이미지 입력 없이도 포인트 클라우드만으로 종단 간 3D 검출을 가능하게 함.

제안 방법

  • 포인트 클라우드 특징에서 유도된 3D 박스 기하학적 사전 지식과 CLIP에서 유도된 2D 시맨틱 사전 지식을 활용해 훈련 중에 새로운 객체를 위한 가짜 3D 박스 레이블을 생성하는 3D 신규 객체 탐지(3D-NOD) 전략 제안.
  • 기초 및 탐지된 새로운 객체 박스를 모두 활용해 포인트 클라우드, 2D 이미지, 텍스트 특징 간 클래스 무관 및 클래스 구별 특징 정렬을 수행하는 발견 기반 다중모달 정렬(DCMA) 모듈 설계.
  • 카테고리 감독 없이 객체 제안 영역 수준에서 3D 및 2D 특징을 정렬하는 박스 기반 특징 정제 기법 구현.
  • 대규모 오픈 뷰포인트에서 기초 카테고리와 탐지된 새로운 카테고리를 포함해 CLIP 텍스트 특징과 3D 객체 특징을 대비 학습을 통해 정렬.
  • 3D-NOD와 DCMA를 종단 간 방식으로 공동 최적화하며, 탐지된 박스가 정렬을 향상시키고, 더 나은 정렬이 국소화 정확도를 향상시키는 상호 보완적 피드백 제공.
  • 기초 카테고리에 대한 포인트 클라우드 애너테이션만을 사용해 모델을 훈련하고, 새로운 카테고리에 대해 CLIP의 제로샷 능력을 가짜 레이블을 통해 활용.

실험 결과

연구 질문

  • RQ1외부 2D 검출 모델에 의존하지 않고도 3D 객체 검출을 오픈 뷰포인트 환경으로 효과적으로 확장할 수 있는가?
  • RQ2제한된 3D 애너테이션과 시각-언어 모델에서 유도된 다중모달 사전 지식만을 사용해 새로운 3D 객체 박스를 어떻게 탐지할 수 있는가?
  • RQ3객체 탐지와 다중모달 정렬의 공동 학습이 기초 및 새로운 카테고리 양측의 검출 성능에 얼마나 기여하는가?
  • RQ4통합 프레임워크가 추론 시에 단지 포인트 클라우드 입력만을 사용해 정확한 국소화와 제로샷 분류를 동시에 달성할 수 있는가?
  • RQ5신규 박스 탐지와 다중모달 정렬 간 협업적 피드백이 종합적인 검출 성능 향상에 어떻게 기여하는가?

주요 결과

  • CoDA는 SUN-RGBD와 ScanNet 데이터셋에서 기존 최고 성능를 기록한 방법 대비 mAP 80% 상승을 달성.
  • ScanNetv2에서 CoDA는 단지 포인트 클라우드만을 입력으로 사용해 mAP 46.30%를 기록하며, 분류에 2D 이미지 입력이 필요한 방법들을 능가.
  • qualitative 비교에서 드레스러와 나이트스탠드와 같은 이전에 볼 수 없었던 카테고리를 성공적으로 탐지해, 새로운 객체에 대한 강력한 일반화 능력을 입증.
  • OV-3DET [15]와 동일한 설정에서의 공정한 비교에서 CoDA는 20개 카테고리 평균 mAP에서 1.3점 높은 성능 기록, 외부 2D 검출 모델을 사용하지 않음에도 불구하고 우월성을 입증.
  • 제거 분석 결과 3D-NOD와 DCMA가 성능 향상에 뚜렷이 기여하며, 상호 보완적 학습을 통해 상호 강화됨을 확인.
  • 기초 및 새로운 카테고리 양측에서 최신 기술 수준의 성능 달성하며, 두 벤치마크 데이터셋에서 모든 AP 및 AR 지표에 걸쳐 일관된 향상 기록.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.