Skip to main content
QUICK REVIEW

[논문 리뷰] Stratified Transformer for 3D Point Cloud Segmentation

Xin Lai, Jianhui Liu|arXiv (Cornell University)|2022. 03. 28.
3D Shape Modeling and Analysis인용 수 9
한 줄 요약

이 논문은 3D 포인트 클라우드 세분화를 위한 새로운 프레임워크인 Stratified Transformer를 제안한다. 이 방법은 가까운 점들 외에도 먼 점들을 희박하게 샘플링하여 키로 사용함으로써 장거리 컨텍스트 모델링을 향상시키며, 계산 비용을 최소화하면서도 큰 효과적 수용장역을 확보한다. 첫 번째 레이어의 포인트 임베딩, 상황적 상대 위치 인코딩, 메모리 효율적인 구현 방식을 통합함으로써 S3DIS, ScanNetv2, ShapeNetPart에서 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

3D point cloud segmentation has made tremendous progress in recent years. Most current methods focus on aggregating local features, but fail to directly model long-range dependencies. In this paper, we propose Stratified Transformer that is able to capture long-range contexts and demonstrates strong generalization ability and high performance. Specifically, we first put forward a novel key sampling strategy. For each query point, we sample nearby points densely and distant points sparsely as its keys in a stratified way, which enables the model to enlarge the effective receptive field and enjoy long-range contexts at a low computational cost. Also, to combat the challenges posed by irregular point arrangements, we propose first-layer point embedding to aggregate local information, which facilitates convergence and boosts performance. Besides, we adopt contextual relative position encoding to adaptively capture position information. Finally, a memory-efficient implementation is introduced to overcome the issue of varying point numbers in each window. Extensive experiments demonstrate the effectiveness and superiority of our method on S3DIS, ScanNetv2 and ShapeNetPart datasets. Code is available at https://github.com/dvlab-research/Stratified-Transformer.

연구 동기 및 목표

  • 기존 3D 포인트 클라우드 세분화 방법이 局부 기능 집합에 의존함으로써 장거리 상관관계를 모델링하는 데에 한계가 있음에 대응하기 위해.
  • 계산 효율성이나 위치 정확도를 희생시키지 않고 3D 트랜스포머에서 효율적인 장거리 어텐션을 가능하게 하기 위해.
  • 불규칙적인 3D 포인트 클라우드 데이터와 변동하는 포인트 수에 특화된 강력하고 일반화 가능한 트랜스포머 아키텍처를 설계하기 위해.
  • 3D 포인트 클라우드 처리에서 발생하는 불규칙한 공간 배치와 다양한 창 크기의 과제를 극복하기 위해.

제안 방법

  • 질의 포인트 각각에 대해 가까운 점들을 조밀하게 샘플링하고, 먼 점들을 희박하게 샘플링하여 키로 사용하는 계층적 키 샘플링 전략을 도입함으로써 효과적 수용장역을 확장한다.
  • 학습 중 수렴성과 성능 향상을 위해 국소 특징을 집합하는 데 첫 번째 레이어의 포인트 임베딩을 활용한다.
  • 공간 좌표와 의미적 특징을 모두 사용하여 동적으로 위치 편향을 모델링하는 상황적 상대 위치 인코딩(cRPE)을 적용한다.
  • 포인트 수가 적은 창에서도 메모리 소비를 줄이기 위해 메모리 효율적인 구현 방식을 사용하며, 변동하는 포인트 수에 적응한다.
  • 교차 창 정보 흐름을 향상시켜 특징 표현을 개선하기 위해 이동 창 전략을 채택한다.
  • 기본 다중헤드 자기어텐션을 수정된 키 샘플링 방식과 함께 사용하여 위치 무결성을 유지하면서도 장거리 모델링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1저비용 계산 부담으로 3D 포인트 클라우드 세분화에서 장거리 상관관계를 효과적으로 모델링할 수 있는가?
  • RQ2트랜스포머 기반 3D 세분화 프레임워크에서 불규칙한 포인트 배열을 효과적으로 다룰 수 있는가?
  • RQ3기본 다중헤드 자기어텐션은 강력한 일반화력과 성능을 갖추고 3D 포인트 클라우드에 적합하게 조정될 수 있는가?
  • RQ4상황적 상대 위치 인코딩이 3D 트랜스포머 성능 향상에 어떤 역할을 하는가?
  • RQ5제안된 계층적 키 샘플링 전략은 전통적인 局부 또는 전역 어텐션과 비교해 효율성과 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • Stratified Transformer는 S3DIS 데이터셋에서 최신 기준 mIoU 72.0%를 달성하여 이전 방법들을 능가한다.
  • ScanNetv2에서 모델은 mIoU 72.0%를 기록하여 다양한 실세계 환경에서 뛰어난 일반화 능력을 보여준다.
  • ShapeNetPart에서 이 방법은 mIoU 89.2%를 달성하여 부분 수준 세분화에서 뛰어난 성능을 보인다.
  • 절단 실험 결과, cRPE가 쿼리, 키, 밸류 특징에 모두 적용되었을 때 최고의 성능을 기록하였으며, 모든 데이터 증강 기법을 사용할 경우 mIoU가 5.9% 향상되었다.
  • 모델는 다양한 왜곡 조건에서도 뛰어난 강건성을 보이며, 90° Z축 회전 조건에서도 72.02%의 mIoU를 유지한다.
  • 메모리 효율적인 구현 방식은 특히 포인트 수가 적은 창에서 메모리 소비를 크게 줄였으며, 성능에 영향을 주지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.