Skip to main content
QUICK REVIEW

[논문 리뷰] OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance Segmentation

Zhening Huang, Xiaoyang Wu|arXiv (Cornell University)|2023. 09. 01.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

OpenIns3D는 2D 이미지 입력 없이도 작동하는 3D 오픈-보기어드(instance segmentation) 프레임워크를 제안한다. 이는 '마스크-스냅-룩업' 파이프라인을 사용한다: 3D 포인트 클라우드에서 클래스에 관계없는 마스크 제안을 생성하고, 2D 비전-언어 모델을 위해 다중 스케일의 시나리오 이미지를 합성하며, 마스크2픽셀 대응 관계를 통해 결과를 다시 3D로 매핑한다. 이 방법은 실내 및 실외 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 재학습 없이도 ODISE 및 LISA와 같은 고급 2D 모델과 즉시 통합 가능하다.

ABSTRACT

In this work, we introduce OpenIns3D, a new 3D-input-only framework for 3D open-vocabulary scene understanding. The OpenIns3D framework employs a "Mask-Snap-Lookup" scheme. The "Mask" module learns class-agnostic mask proposals in 3D point clouds, the "Snap" module generates synthetic scene-level images at multiple scales and leverages 2D vision-language models to extract interesting objects, and the "Lookup" module searches through the outcomes of "Snap" to assign category names to the proposed masks. This approach, yet simple, achieves state-of-the-art performance across a wide range of 3D open-vocabulary tasks, including recognition, object detection, and instance segmentation, on both indoor and outdoor datasets. Moreover, OpenIns3D facilitates effortless switching between different 2D detectors without requiring retraining. When integrated with powerful 2D open-world models, it achieves excellent results in scene understanding tasks. Furthermore, when combined with LLM-powered 2D models, OpenIns3D exhibits an impressive capability to comprehend and process highly complex text queries that demand intricate reasoning and real-world knowledge. Project page: https://zheninghuang.github.io/OpenIns3D/

연구 동기 및 목표

  • 2D 이미지가 이용 불가능하거나 3D 포인트 클라우드와 정렬되지 않은 환경에서 3D 오픈-보기어드 인스턴스 세그멘테이션을 가능하게 하기 위해.
  • 기존 3D 오픈-보기어드 방법들이 잘 정렬된 2D-3D 데이터 쌍에 의존하는 한계를 극복하기 위해.
  • 3D 입력을 위해 재학습이 필요 없이 강력한 사전 훈련된 2D 비전-언어 모델을 활용할 수 있는 융통성 있는 프레임워크를 개발하기 위해.
  • 단지 3D 포인트 클라우드만을 입력으로 사용하면서도, 복잡한 추론 중심의 텍스트 쿼리와도 호환되는 고품질의 3D 인스턴스 세그멘테이션을 달성하기 위해.

제안 방법

  • 마스크 모듈은 클래스에 관계없는 마스크 제안을 생성하기 위해 3D 포인트 클라우드에서 마스크 제안 모듈(MPM)을 사용하며, 훈련 시 클래스 레이블이 필요하지 않다.
  • 마스크 스코링 모듈은 마스크 품질을 평가하고, 마스크 필터링 기법을 통해 저품질 또는 분할된 제안을 제거한다.
  • 스냅 모듈은 모든 마스크 제안을 커버할 수 있도록 최적화된 카메라 자세와 내재 매개변수를 사용하여 다중 스케일의 시나리오 2D 이미지를 합성한다.
  • 2D 오픈-보기어드 모델(예: ODISE, LISA)은 합성된 이미지를 처리하여 객체를 탐지하고 분류하며, 카테고리 및 픽셀 위치 데이터를 포함한 클래스 룩업 테이블(CLT)을 생성한다.
  • 룩업 모듈은 사전에 계산된 마스크2픽셀 맵을 사용하여 3D 마스크 제안을 합성된 2D 이미지에 투영함으로써 공간적 대응을 통해 정확한 카테고리 할당을 가능하게 한다.
  • 이 프레임워크는 모듈식이며, 3D 백본을 재학습하지 않고도 어떤 2D 검출기나 비전-언어 모델과도 즉시 통합 가능하다.

실험 결과

연구 질문

  • RQ12D 이미지 입력이나 2D-3D 정렬에 의존하지 않고도 3D 오픈-보기어드 인스턴스 세그멘테이션을 달성할 수 있는가?
  • RQ2쌍체화된 2D 이미지가 없는 상황에서 강력한 2D 비전-언어 모델의 능력을 3D 포인트 클라우드로 효과적으로 이관할 수 있는가?
  • RQ3유연하고 2D 입력이 없는 프레임워크가 다양한 3D 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ4기반 2D 모델의 추론 및 일반화 능력이 증가함에 따라 프레임워크의 성능이 어떻게 변화하는가?
  • RQ52D 감독 없이도 세계 지식과 추론이 필요한 복잡한 개방형 텍스트 쿼리를 처리할 수 있는가?

주요 결과

  • OpenIns3D는 실내(S3DIS, ScanNetv2) 및 실외(STPLS3D) 데이터셋에서 오픈-보기어드 인스턴스 세그멘테이션 분야에서 최신 기술 수준 성능을 달성하며, 이는 이전 방법들보다 크게 뛰어난 성능이다.
  • S3DIS 데이터셋에서 OpenIns3D는 ODISE를 사용할 경우 39.5%의 평균 마스크 AP를 기록하고, LISA를 사용할 경우 41.8%를 기록하여 이전 최고 성능 방법들을 크게 앞서 간다.
  • ScanNetv2에서 이 방법은 ODISE를 사용할 경우 38.7%의 평균 마스크 AP를 기록하고, LISA를 사용할 경우 40.1%를 기록하여 다양한 도메인에서 강력한 일반화 능력을 보여준다.
  • LISA와 통합되었을 때 OpenIns3D는 '파란 쓰레기통 근처의 빨간 자전거를 찾아줘'와 같은 복잡하고 추론 중심의 쿼리를 성공적으로 처리하여 강력한 제로샷 일반화 능력을 보였다.
  • 작거나 흐린 마스크 영역에서도 높은 성능를 유지하지만, 매우 작은 또는 분할된 포인트 클라우드 영역에서는 성능 저하가 약간 발생한다.
  • 이 방법은 새로운 2D 모델과의 통합이 원활하다 — ODISE에서 LISA로 전환하는 데 재학습이 필요 없으며, 이는 모듈성과 적응 가능성의 높음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.