Skip to main content
QUICK REVIEW

[논문 리뷰] Object2Scene: Putting Objects in Context for Open-Vocabulary 3D Detection

Chenming Zhu, Wenwei Zhang|arXiv (Cornell University)|2023. 09. 18.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

Object2Scene는 대규모이고 다양한 3D 객체를 대규모 어휘를 가진 3D 객체 데이터셋에서 가져와 3D 시점 데이터셋을 풍부화시키는 새로운 프레임워크를 제안한다. 이는 정밀한 3D 경계상자와 언어 기반 프ompts를 생성하여 개방형 어휘 3D 객체 검출을 가능하게 한다. 이 방법은 교차 도메인 대비 학습과 통합된 검출-기반 모델(L3Det)을 활용하여 SOTA 성능을 달성하며, OV-ScanNet-200 벤치마크에서 mAP_{25} 24.62%를 기록한다.

ABSTRACT

Point cloud-based open-vocabulary 3D object detection aims to detect 3D categories that do not have ground-truth annotations in the training set. It is extremely challenging because of the limited data and annotations (bounding boxes with class labels or text descriptions) of 3D scenes. Previous approaches leverage large-scale richly-annotated image datasets as a bridge between 3D and category semantics but require an extra alignment process between 2D images and 3D points, limiting the open-vocabulary ability of 3D detectors. Instead of leveraging 2D images, we propose Object2Scene, the first approach that leverages large-scale large-vocabulary 3D object datasets to augment existing 3D scene datasets for open-vocabulary 3D object detection. Object2Scene inserts objects from different sources into 3D scenes to enrich the vocabulary of 3D scene datasets and generates text descriptions for the newly inserted objects. We further introduce a framework that unifies 3D detection and visual grounding, named L3Det, and propose a cross-domain category-level contrastive learning approach to mitigate the domain gap between 3D objects from different datasets. Extensive experiments on existing open-vocabulary 3D object detection benchmarks show that Object2Scene obtains superior performance over existing methods. We further verify the effectiveness of Object2Scene on a new benchmark OV-ScanNet-200, by holding out all rare categories as novel categories not seen during training.

연구 동기 및 목표

  • 학습 예시가 없는 카테고리도 검출할 수 있어야 하는 개방형 어휘 3D 객체 검출 문제에 대응한다.
  • 2D-3D 정렬에 의존하고 국소화 정확도가 낮으며 도메인 갭이 존재하는 기존 2D 이미지 기반 접근법의 한계를 극복한다.
  • 다양한 3D 객체를 포함한 대규모 3D 객체 데이터셋(예: ShapeNet, OmniObject3D)을 활용하여 3D 시점 데이터셋을 풍부화시킨다.
  • 기존에 알려진 카테고리에만 애너테이션된 시점에 새로운 카테고리의 객체를 삽입함으로써 발생하는 일관성 없는 애너테이션 문제를 완화한다.
  • 텍스트 프ompts를 사용해 3D 객체 검출과 3D 언어 기반을 동시에 수행할 수 있는 통합 모델 L3Det을 개발하여 제로샷 일반화 성능을 향상시킨다.

제안 방법

  • 물리적 기능과 기준 객체 가이던스를 활용해 3D 시점 포인트 클라우드에 대규모 어휘 3D 객체 데이터셋에서 유래한 3D 객체를 삽입하여 현실적인 배치를 보장한다.
  • 예를 들어 '방 중심에 식물 근처에 테이블이 있는' 등의 언어 기반 프ompts를 생성하여 클래스 레이블의 모호함을 제거하고 삽입된 객체의 정밀한 국소화를 가능하게 한다.
  • 삽입된 3D 객체를 정규화하고 재샘플링하여 타겟 시점 데이터셋의 스케일과 분포와 일치시켜 도메인 이탈을 줄인다.
  • 포인트 클라우드와 텍스트 입력을 동시에 처리하는 통합형 트랜스포머 기반 모델인 L3Det을 제안하여 3D 객체 검출과 3D 언어 기반을 동시에 수행한다.
  • 다른 데이터셋(예: ShapeNet와 ScanNet)의 객체 간 특징 표현을 정렬하기 위해 도메인 간 카테고리 수준의 대비 학습 기법을 도입하여 도메인 갭을 줄인다.
  • 학습 중에 데이터 증강 기법(회전, 포인트 제거, 저자극)을 적용하여 모델의 강건성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ12D 이미지 감독 없이 대규모 3D 객체 데이터셋을 효과적으로 활용하여 개방형 어휘 3D 객체 검출을 위한 3D 시점 데이터셋을 풍부화시킬 수 있는가?
  • RQ2기존 시점 객체만 애너테이션되어 있고 삽입된 새로운 카테고리 객체는 애너테이션되지 않은 상황에서 발생하는 일관성 없는 애너테이션 문제를 데이터 구축 과정에서 어떻게 완화할 수 있는가?
  • RQ3어느 종류의 언어 프ompts(검출 프ompts, 절대 위치, 상대 위치)가 개방형 어휘 3D 객체 검출에서 제로샷 일반화를 가장 잘 지원하는가?
  • RQ4도메인 간 카테고리 수준의 대비 학습이 서로 다른 데이터셋에서 온 3D 객체 간 도메인 이탈을 어느 정도 줄이는가?
  • RQ5ShapeNet 및 OmniObject3D와 같은 다양한 출처에서 온 3D 객체의 다양성이 모델의 개방형 어휘 검출 성능에 어떤 영향을 미치는가?

주요 결과

  • Object2Scene는 모든 희귀 카테고리가 훈련 중에 새로운 카테고리로 간주되는 OV-ScanNet-200 벤치마크에서 mAP_{25} 24.62%를 기록하여 강력한 제로샷 일반화 능력을 입증한다.
  • ShapeNet과 OmniObject3D를 외부 객체 소스로 동시에 활용할 경우 mAP_{25}가 11.21%에서 24.62%로 상승하여 객체 다양성이 성능 향상에 크게 기여함을 보여준다.
  • 랜덤 3D 객체 배치를 적용하면 mAP_{25}가 2.83%포인트 상승(18.48%에서 21.31%로)하여 랜덤 배치에서 유도된 데이터 다양성이 모델의 강건성을 향상시킨다는 것을 시사한다.
  • 상대 위치 프ompts(예: '테이블 근처에 의자가 있는')가 mAP_{25} 21.31%로 가장 높은 성능을 기록하여 객체 역할의 모호함을 더 잘 제거함으로써 검출 및 절대 위치 프ompts를 능가한다.
  • 객체 정규화 및 재샘플링을 통해 mAP_{25}가 2.34%에서 6.41%로 상승하여 소스 데이터셋과 타겟 데이터셋 간 특징 분포 일치의 중요성을 입증한다.
  • 교차 도메인 카테고리 수준의 대비 학습을 정규화 및 증강 이후 적용할 경우 mAP_{25}가 7.34%에서 11.21%로 상승하여 도메인 갭 감소에 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.