Skip to main content
QUICK REVIEW

[논문 리뷰] Box2Mask: Weakly Supervised 3D Semantic Instance Segmentation Using Bounding Boxes

Julian Chibane, Francis Engelmann|arXiv (Cornell University)|2022. 06. 02.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 3D 세분화 인스턴스 세분화를 위한 약한 지도 학습 방법인 Box2Mask를 제안한다. 이 방법은 포인트별로 레이블을 붙이는 데 드는 비용을 피하기 위해 3D 경계 상자(annotation)만을 사용하여 딥 모델을 훈련시킨다. 후후 투표에 영감을 얻어, 이 방법은 직접적으로 상자 파라미터를 회귀하고 투표를 군집화하여 조밀한 인스턴스 마스크를 생성한다. 이는 ScanNet에서 완전히 지도 학습된 모델의 mAP50 점수의 97%를 달성하며, ARKitScenes 데이터셋에서도 상자 수준의 레이블만으로 뛰어난 성능을 내고 있다.

ABSTRACT

Current 3D segmentation methods heavily rely on large-scale point-cloud datasets, which are notoriously laborious to annotate. Few attempts have been made to circumvent the need for dense per-point annotations. In this work, we look at weakly-supervised 3D semantic instance segmentation. The key idea is to leverage 3D bounding box labels which are easier and faster to annotate. Indeed, we show that it is possible to train dense segmentation models using only bounding box labels. At the core of our method, ame{}, lies a deep model, inspired by classical Hough voting, that directly votes for bounding box parameters, and a clustering method specifically tailored to bounding box votes. This goes beyond commonly used center votes, which would not fully exploit the bounding box annotations. On ScanNet test, our weakly supervised model attains leading performance among other weakly supervised approaches (+18 mAP@50). Remarkably, it also achieves 97% of the mAP@50 score of current fully supervised models. To further illustrate the practicality of our work, we train Box2Mask on the recently released ARKitScenes dataset which is annotated with 3D bounding boxes only, and show, for the first time, compelling 3D instance segmentation masks.

연구 동기 및 목표

  • 3D 세분화 인스턴스 세분화에서 레이블링 부담을 줄이기 위해, 더 쉽게 레이블링할 수 있는 3D 경계 상자로 포인트별로 레이블링을 대체한다.
  • 딥 러닝 방법을 개발하여 경계 상자 레이블을 최대한 활용해 조밀한 예측을 수행하며, 단순한 중심점 지도 학습을 넘어서는 것을 목표로 한다.
  • 경계 상자에서 훈련된 약한 지도 학습 모델이 이전의 약한 지도 학습 방법보다 성능이 유사하거나 뛰어나다는 것을 입증한다.
  • ARKitScenes와 같이 대규모 데이터셋에서 3D 경계 상자로만 레이블링된 경우에도 고성능의 3D 인스턴스 세분화를 가능하게 한다.

제안 방법

  • 포인트 클라우드 특징에서 3D 경계 상자 파라미터(중심, 크기, 클래스)를 직접적으로 회귀하는 딥 후후 투표 네트워크를 제안한다.
  • 경계 상자 예측에서 유도된 투표 군집에 특화된 미분 가능한 군집화 메커니즘을 사용하여 인스턴스 마스크를 생성한다.
  • 포인트와 진짜 경계 상자 간의 새로운 포인트-박스 연관 함수를 도입하며, 여러 상자에 속하는 불확실한 포인트는 가장 가까운 또는 가장 작은 상자와 같은 히ュ리스틱 기반으로 지도 학습한다.
  • 포인트-박스 연관 관계를 활용하여 조밀한 예측을 지도 학습하는 약한 지도 학습 손실을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 감독 신호를 전환하기만 하면 약한 지도 학습 및 완전히 지도 학습 설정 모두에 적용 가능한 프레임워크를 설계한다.
  • 마스크 생성을 위해 후처리를 사용하는 단순한 검출 전용 접근 방식보다 성능이 뛰어나다.

실험 결과

연구 질문

  • RQ13D 경계 상자 레이블만으로도 고성능의 3D 세분화 인스턴스 세분화 모델을 훈련시킬 수 있는가?
  • RQ2경계 상자에서 훈련된 약한 지도 학습 모델의 성능은 완전히 지도 학습된 최신 기술 모델과 비교해 어떻게 되는가?
  • RQ3제안된 방법은 단순한 포인트-연결을 넘어서 완전한 객체 사전 지식을 학습할 수 있는가?
  • RQ4노이즈가 있거나 부정확한 경계 상자 레이블에 대해 이 방법은 얼마나 강인한가?
  • RQ53D 경계 상자로만 레이블링된 대규모 데이터셋에서도 이 방법은 매력적인 인스턴스 세분화 결과를 낼 수 있는가?

주요 결과

  • ScanNet 테스트 스플릿에서 Box2Mask는 64.7 mAP50를 기록했으며, 이는 완전히 지도 학습된 SSTNet 모델의 mAP50 점수(64.3 mAP50)의 97%에 해당한다.
  • 이전의 약한 지도 학습 방법보다 큰 격차로 성능을 뛰어넘었으며, 이전의 약한 지도 학습 접근 방식보다 mAP50가 +18 향상되었다.
  • 경계 상자 중 80%만 존재할 경우(10% 손실)에도 강력한 성능 유지가 가능했으며, mAP50가 약 ~4점 감소하는 데 그쳤다.
  • 모서리 위치에 최대 20cm의 오차가 있는 노이즈가 있는 상자 레이블로도 훈련했을 때, 성능 저하가 최소한이었으며 강인함을 보였다.
  • 3D 경계 상자로만 레이블링된 ARKitScenes 데이터셋에서 Box2Mask는 처음으로 매력적인 3D 인스턴스 세분화 마스크를 생성했으며, 실용적 적용 가능성을 입증했다.
  • 검출 전용 기반 모델보다 훨씬 뛰어난 성능을 보였으며, ScanNet에서 mAP50가 +11.8 향상되었으며, 단순한 상자-포인트 연관보다 더 rich한 객체 사전 지식을 학습하고 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.