Skip to main content
QUICK REVIEW

[논문 리뷰] APPT : Asymmetric Parallel Point Transformer for 3D Point Cloud Understanding

Hengjia Li, Zhengkai Tu|arXiv (Cornell University)|2023. 03. 31.
3D Shape Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 전역 피봇 어텐션(GPA)과 비대칭 평행 브랜치를 통해 전역적 맥락 모델링을 향상시키는 새로운 3D 포인트 클라우드 네트워크인 비대칭 평행 포인트 트랜스포머(APPT)을 제안한다. 원거리 어텐션을 효율적으로 구현하기 위해 최대 거리 샘플링된 피봇 포인트를 사용하고, 채널/샘플링 비율을 점진적으로 증가시키는 전략을 적용함으로써, S3DIS, ModelNet40, ShapeNet 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, mIoU 개선 폭이 최대 72.3%에 이른다.

ABSTRACT

Transformer-based networks have achieved impressive performance in 3D point cloud understanding. However, most of them concentrate on aggregating local features, but neglect to directly model global dependencies, which results in a limited effective receptive field. Besides, how to effectively incorporate local and global components also remains challenging. To tackle these problems, we propose Asymmetric Parallel Point Transformer (APPT). Specifically, we introduce Global Pivot Attention to extract global features and enlarge the effective receptive field. Moreover, we design the Asymmetric Parallel structure to effectively integrate local and global information. Combined with these designs, APPT is able to capture features globally throughout the entire network while focusing on local-detailed features. Extensive experiments show that our method outperforms the priors and achieves state-of-the-art on several benchmarks for 3D point cloud understanding, such as 3D semantic segmentation on S3DIS, 3D shape classification on ModelNet40, and 3D part segmentation on ShapeNet.

연구 동기 및 목표

  • 기존의 트랜스포머 기반 3D 포인트 클라우드 네트워크에서 전역 의존성을 간과하는 경향이 있는 제한된 유효 수신장의 문제를 해결하기 위해.
  • 3D 포인트 클라우드 표현 학습에서 국소 기하학적 세부 정보와 전역 의미적 맥락을 효과적으로 통합하기 위해.
  • 대규모 포인트 클라우드에 잘 스케일링되는 계산 효율적인 전역 어텐션 메커니즘을 설계하기 위해.
  • 네트워크 깊이에 따라 점진적인 채널 및 샘플링 비율을 적용한 비대칭 평행 아키텍처의 효과를 검증하기 위해.

제안 방법

  • 원거리 의존성을 효율적으로 모델링하기 위해 최대 거리로 샘플링된 피봇 포인트를 사용하는 스칼라 어텐션 메커니즘인 전역 피봇 어텐션(GPA)을 제안한다.
  • 국소 특징는 국소 그룹 어텐션(LGA)으로 처리하고, 전역 특징는 GPA로 처리하는 별도의 평행 스트림으로 구성된 비대칭 평행 블록을 도입한다.
  • 하층에서 상층으로 갈수록 전역 브랜치에 할당된 채널 비율을 점진적으로 증가시키는 램프형 채널 비율 전략을 적용한다.
  • 네트워크 깊이가 증가함에 따라 전역 브랜치의 피봇 포인트 수를 점진적으로 증가시키는 램프형 샘플링 비율 전략을 적용한다.
  • 간단한 연결(concatenation)을 통한 특징 융합 전략을 사용하며, 이는 요소별 합산이나 SE 기반 연결보다 성능이 뛰어나다.
  • 이러한 구성 요소들을 통합하여 엔드 투 엔드 3D 포인트 클라우드 이해를 위한 전체 네트워크 아키텍처인 APPT를 설계한다.

실험 결과

연구 질문

  • RQ1샘플링된 피봇을 기반으로 한 전역 어텐션 메커니즘이 3D 포인트 클라우드 네트워크에서 유효 수신장을 효과적으로 확장할 수 있는가?
  • RQ2심층 3D 포인트 클라우드 네트워크에서 국소 및 전역 특징를 높은 계산 오버헤드 없이 효과적으로 통합할 수 있는가?
  • RQ3얕은 층에서 깊은 층으로 갈수록 전역 특징 용량을 점진적으로 증가시키는 것이 3D 이해 작업 성능 향상에 기여하는가?
  • RQ4제안된 비대칭 평행 아키텍처는 순차적 또는 대칭적 설계 대비 특징 융합 및 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • APPT는 S3DIS 3D 세분화 벤치마크에서 72.3%의 mIoU를 기록하여 Point Transformer 및 Stratified Transformer를 포함한 이전 방법들을 능가한다.
  • 절연 분석을 통해 GPA를 포함한 평행 설계가 72.3% mIoU를 달성하며, 순차적 설계(70.9% mIoU)보다 뚜렷하게 뛰어난 성능을 보였다.
  • 특히 원거리 의존성 모델링에서 Stratified Transformer(ST), Squeeze-Extraction(SE), Global Context(GC)와 같은 다른 전역 모듈보다 GPA가 뛰어난 성능을 보였다.
  • 램프형 채널 비율 전략($C_g/C\uparrow$)은 가장 높은 mIoU(72.3%)를 기록했으며, 고정 비율 또는 감소 비율 전략보다 더 효과적이었다.
  • 램프형 샘플링 비율 전략($M/N\uparrow$)은 최고의 성능(72.3% mIoU)을 기록했으며, 깊은 층에서 피봇 포인트 수를 증가시키는 것이 유리함을 입증했다.
  • 국소 및 전역 특징의 단순한 연결이 가장 높은 성능(72.3% mIoU)을 기록했으며, Squeeze-Extraction 기반 융합이나 요소별 합산보다 뛰어났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.