Skip to main content
QUICK REVIEW

[논문 리뷰] Voxel Set Transformer: A Set-to-Set Approach to 3D Object Detection from Point Clouds

Chenhang He, Ruihuang Li|arXiv (Cornell University)|2022. 03. 19.
Advanced Neural Network Applications인용 수 12
한 줄 요약

이 논문은 불규칙하게 분포한 포인트 클라우드에서 효율적이고 병렬적이며 고용량의 자기주의를 가능하게 하는 바이트 기반 세트 어텐션(VSA) 모듈을 사용하는 새로운 세트-세트 3D 객체 검출 프레임워크인 볼륨 세트 트랜스포머(VoxSeT)를 제안한다. 학습 가능한 잠재 코드를 사용해 볼륨 특징을 압축하고 자기주의를 두 개의 크로스 어텐션 모듈로 분해함으로써 VoxSeT는 선형 복잡도를 달성하고 KITTI 및 Waymo 벤치마크에서 경쟁적인 성능을 내며, 기존의 CNN 및 포인트 기반 모델보다 일반화 능력과 효율성에서 뛰어나다.

ABSTRACT

Transformer has demonstrated promising performance in many 2D vision tasks. However, it is cumbersome to compute the self-attention on large-scale point cloud data because point cloud is a long sequence and unevenly distributed in 3D space. To solve this issue, existing methods usually compute self-attention locally by grouping the points into clusters of the same size, or perform convolutional self-attention on a discretized representation. However, the former results in stochastic point dropout, while the latter typically has narrow attention fields. In this paper, we propose a novel voxel-based architecture, namely Voxel Set Transformer (VoxSeT), to detect 3D objects from point clouds by means of set-to-set translation. VoxSeT is built upon a voxel-based set attention (VSA) module, which reduces the self-attention in each voxel by two cross-attentions and models features in a hidden space induced by a group of latent codes. With the VSA module, VoxSeT can manage voxelized point clusters with arbitrary size in a wide range, and process them in parallel with linear complexity. The proposed VoxSeT integrates the high performance of transformer with the efficiency of voxel-based model, which can be used as a good alternative to the convolutional and point-based backbones. VoxSeT reports competitive results on the KITTI and Waymo detection benchmarks. The source codes can be found at \url{https://github.com/skyhehe123/VoxSeT}.

연구 동기 및 목표

  • 대규모이고 희박한 3D 포인트 클라우드에서 표준 자기주의의 제곱형 복잡도와 비효율성을 해결하기 위해.
  • 바이트화된 표현에서 군집 기반 방법의 확률적 포인트 드롭아웃과 컨볼루션 어텐션의 좁은 수용장과 같은 제약을 극복하기 위해.
  • 포인트 클라우드 처리를 세트-세트 번역으로 모델링하여 3D 객체 검출에서 전체 해상도 특징 학습을 가능하게 하기 위해.
  • KITTI 및 Waymo와 같은 다양한 3D 검출 벤치마크에서 모델링 용량과 일반화 능력을 향상시키기 위해.
  • 실시간 3D 검출에서 희박한 CNN과 포인트 기반 트랜스포머에 대한 효율적이고 병렬 처리 가능한 대안을 제공하기 위해.

제안 방법

  • 볼륨 세트 어텐션(VSA) 모듈은 겹치지 않는 3D 볼륨을 사용해 포인트 클라우드를 군집하고, 학습 가능한 잠재 코드를 통해 두 단계의 크로스 어텐션 메커니즘을 적용하여 전체 자기주의를 대체한다.
  • 각 볼륨의 특징은 잠재 코드를 사용해 고정된 크기의 은닉 공간으로 압축되며, 이는 입력 포인트 특징의 키-밸류 투영에 대해 어텐션을 수행하는 쿼리로 기능한다.
  • 은닉 특징은 국소 연결성을 갖는 컨볼루션 피드포워드 네트워크(ConvFFN)에 의해 개선되어 볼륨 간에 공간적 특징을 교환한다.
  • 최종 출력은 개선된 은닉 특징과 원본 입력 특징을 융합하여 해상도와 맥락을 유지한다.
  • 전체 VSA 모듈은 O(nkd)의 복잡도를 가지며, 여기서 n은 입력 포인트 수, k는 잠재 코드 수, d는 특징 차원이다. 이는 벡터화되고 병렬 처리 가능한 계산을 가능하게 한다.
  • VoxSeT 프레임워크는 다수의 VSA 모듈, MLP 및 얕은 CNN을 통합하여 원시 포인트 클라우드를 종단 간(end-to-end)으로 처리하는 단일 단계 검출기로 구성된다.

실험 결과

연구 질문

  • RQ1세트-세트 번역 프레임워크는 희박한 3D 포인트 클라우드에서 효율적인 어텐션 계산을 가능하게 하면서도 전체 해상도 특징을 유지할 수 있는가?
  • RQ2학습 가능한 잠재 코드를 갖는 볼륨 기반 어텐션 메커니즘은 3D 객체 검출에서 높은 모델링 용량과 선형 복잡도를 동시에 달성할 수 있는가?
  • RQ3제안된 VSA 모듈은 다양한 데이터셋에서 군집 기반 및 컨볼루션 어텐션 메커니즘보다 정확도와 일반화 능력에서 뛰어나게 성능을 냈는가?
  • RQ4잠재 코드의 수가 VSA 모듈의 성능 및 표현 능력에 어떤 영향을 미치는가?
  • RQ5VoxSeT 프레임워크는 기존의 3D 검출기보다 더 낮은 메모리 사용량과 지연 시간으로 실시간 추론을 달성할 수 있는가?

주요 결과

  • VoxSeT는 KITTI 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 'Easy' 수준에서 mAP 89.61, 'Moderate'에서 80.14, 'Hard'에서 78.69를 기록하여 PointNet++ 백본을 사용한 PointRCNN를 뛰어넘었다.
  • Waymo 데이터셋에서는 경쟁적인 mAP 점수를 기록하여 다양한 포인트 클라우드 분포 간 강력한 일반화 능력을 입증하였다.
  • 제거 실험 결과, ConvFFN를 표준 FFN으로 대체할 경우 'Hard' 세트에서 mAP가 10점 이상 감소하여 국소 연결성의 중요성을 입증하였다.
  • 잠재 코드 수를 4개에서 16개로 늘일 경우 KITTI에서 mAP는 76.63에서 78.74로 향상되어 더 많은 코드로 더 나은 맥락 모델링이 가능함을 보여주었다.
  • VoxSeT는 2080Ti GPU를 사용해 KITTI에서 34ms의 추론 시간과 2381MB의 메모리 사용량으로 실행되었으며, SECOND(48ms, 6093MB)를 능가하고 PointPillars(22ms)와 유사한 속도를 기록하면서도 더 높은 정확도를 확보하였다.
  • 시각화 결과, 서로 다른 잠재 코드가 서로 다른 객체 영역에 어텐션을 기울이고 있음을 확인하여 모델의 표현력과 어텐션 다양성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.