Skip to main content
QUICK REVIEW

[논문 리뷰] Superpoint Transformer for 3D Scene Instance Segmentation

Jiahao Sun, Chunmei Qing|arXiv (Cornell University)|2022. 11. 28.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 슈퍼포인트로 포인트 클라우드 특징을 군집화하고, 트랜스포머 기반의 학습 가능한 쿼리 디코더를 사용하여 슈퍼포인트 간의 어텐션을 통해 직접 인스턴스 마스크를 예측하는 새로운 엔드 투 엔드 3D 인스턴스 세그멘테이션 방법인 SPFormer을 제안한다. 이는 중간 집계 또는 후처리가 필요 없이 247ms의 빠른 추론 속도를 유지하면서 ScanNetv2의 숨겨진 테스트 세트에서 이전 최고 성능보다 mAP가 4.3% 높은 성능을 달성한다.

ABSTRACT

Most existing methods realize 3D instance segmentation by extending those models used for 3D object detection or 3D semantic segmentation. However, these non-straightforward methods suffer from two drawbacks: 1) Imprecise bounding boxes or unsatisfactory semantic predictions limit the performance of the overall 3D instance segmentation framework. 2) Existing method requires a time-consuming intermediate step of aggregation. To address these issues, this paper proposes a novel end-to-end 3D instance segmentation method based on Superpoint Transformer, named as SPFormer. It groups potential features from point clouds into superpoints, and directly predicts instances through query vectors without relying on the results of object detection or semantic segmentation. The key step in this framework is a novel query decoder with transformers that can capture the instance information through the superpoint cross-attention mechanism and generate the superpoint masks of the instances. Through bipartite matching based on superpoint masks, SPFormer can implement the network training without the intermediate aggregation step, which accelerates the network. Extensive experiments on ScanNetv2 and S3DIS benchmarks verify that our method is concise yet efficient. Notably, SPFormer exceeds compared state-of-the-art methods by 4.3% on ScanNetv2 hidden test set in terms of mAP and keeps fast inference speed (247ms per frame) simultaneously. Code is available at https://github.com/sunjiahao1999/SPFormer.

연구 동기 및 목표

  • 기존 3D 인스턴스 세그멘테이션 방법이 중간 단계의 객체 검출 또는 의미적 세그멘테이션 단계에 의존하는 데에 기인한 한계를 해결하기 위해.
  • 군집 기반 방법에서 흔히 발생하는 시간 소모적인 집계 단계를 제거하여 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 의미 레이블의 직접적인 지도 없이도 중간 수준의 잠재 표현으로서 슈퍼포인트를 활용하여 인스턴스 세그멘테이션 정확도를 향상시키기 위해.
  • 학습 가능한 쿼리 벡터와 슈퍼포인트 특징 간의 크로스 어텐션을 통해 인스턴스 수준의 정보를 포착하는 쿼리 디코더를 설계하기 위해.
  • 비최대 억제 기법과 중간 처리 단계를 피하여 고성능이면서도 빠른 추론을 달성하기 위해.

제안 방법

  • 입력 포인트 클라우드에서 점별 특징을 추출하기 위해 희소 3D U-Net을 사용한다.
  • 슈퍼포인트 풀링 레이어가 이러한 특징을 슈퍼포인트로 군집화하여 3D 장면의 잠재적인 중간 수준 표현으로 기능한다.
  • 트랜스포머 기반의 쿼리 디코더를 사용한 크로스 어텐션을 통해 슈퍼포인트 특징에 주목함으로써 학습 가능한 쿼리 벡터가 인스턴스를 제안한다.
  • 쿼리 디코더는 경계 상자나 의미 레이블에 의존하지 않고 슈퍼포인트 특징에서 직접 인스턴스 클래스, 점수, 마스크 예측을 생성한다.
  • 슈퍼포인트 마스크 기반의 이분할 매칭을 통해 중간 집계 또는 정밀 조정 모듈 없이 엔드 투 엔드 학습을 가능하게 한다.
  • 마스크 예측을 위해 딱딱함 손실과 이진 교차 엔트로피 손실의 조합을 사용하며, 이는 추이적 분석에서 최적임을 입증하였다.

실험 결과

연구 질문

  • RQ1하나의 하이브리드 이중 단계 프레임워크인 하향식 슈퍼포인트 군집화와 상향식 쿼리 기반 제안을 조합하면 3D 인스턴스 세그멘테이션 성능을 향상시킬 수 있는가?
  • RQ2중간 집계 단계가 추론 속도를 저하시키는 것을 방지하기 위해 엔드 투 엔드 학습을 어떻게 달성할 수 있는가?
  • RQ3자기 어텐션과 크로스 어텐션을 사용하여 슈퍼포인트 특징에서 인스턴스 수준의 정보를 포착하는 데 최적의 쿼리 디코더 설계는 무엇인가?
  • RQ4의미적 또는 중심 지도 없이도 잠재적인 슈퍼포인트 특징을 사용하면 의미적 또는 중심 지도에 의존하는 방법보다 일반화 성능이 향상되는가?
  • RQ5제안된 방법은 고성능을 달성하면서도 빠른 추론 속도를 유지할 수 있는가?

주요 결과

  • SPFormer는 이전 최고 성능 방법보다 ScanNetv2 숨겨진 테스트 세트에서 mAP가 4.3% 높게 달성되었다.
  • 모델은 1 프레임당 247ms의 빠른 추론 속도를 유지하여 집계 단계가 필요한 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 추이적 분석 결과, 딱딱함 손실과 이진 교차 엔트로피 손실의 조합이 마스크 예측 성능을 최적화함을 보여주었다.
  • 6개의 트랜스포머 디코더 레이어와 400개의 쿼리 벡터를 사용할 경우 최적의 성능를 달성하였으며, 800개의 쿼리로 성능 포화가 발생하였다.
  • 트랜스포머 디코더에서 위치 인코딩을 제거해도 성능 저하가 발생하지 않았으며, 이는 3D 포인트 클라우드의 비정규성 때문일 것이다.
  • 크로스 어텐션 메커니즘이 관심 영역을 효과적으로 강조함을 시각화된 어텐션 히트맵과 해당 마스크 예측을 통해 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.