[논문 리뷰] Voxel Transformer for 3D Object Detection
이 논문은 3D 객체 검출을 위한 희소하고 효율적인 트랜스포머 백본인 볼록 트랜스포머(VoTr)를 제안한다. 기존의 3D 컨볼루션 네트워크를 대체하여 자기주의(self-attention)를 활용해 희소한 볼록 간의 장거리 컨텍스트를 포착한다. 국소 및 희석된(self-attention) 어텐션 메커니즘과 빠른 볼록 쿼리(Fast Voxel Query)를 도입함으로써, KITTI 및 Waymo Open 데이터셋에서 상태의 성능을 달성하면서도 오직 20ms의 지연 증가만을 유발하며 모델 파라미터를 감소시키고 높은 추론 속도를 유지한다.
We present Voxel Transformer (VoTr), a novel and effective voxel-based Transformer backbone for 3D object detection from point clouds. Conventional 3D convolutional backbones in voxel-based 3D detectors cannot efficiently capture large context information, which is crucial for object recognition and localization, owing to the limited receptive fields. In this paper, we resolve the problem by introducing a Transformer-based architecture that enables long-range relationships between voxels by self-attention. Given the fact that non-empty voxels are naturally sparse but numerous, directly applying standard Transformer on voxels is non-trivial. To this end, we propose the sparse voxel module and the submanifold voxel module, which can operate on the empty and non-empty voxel positions effectively. To further enlarge the attention range while maintaining comparable computational overhead to the convolutional counterparts, we propose two attention mechanisms for multi-head attention in those two modules: Local Attention and Dilated Attention, and we further propose Fast Voxel Query to accelerate the querying process in multi-head attention. VoTr contains a series of sparse and submanifold voxel modules and can be applied in most voxel-based detectors. Our proposed VoTr shows consistent improvement over the convolutional baselines while maintaining computational efficiency on the KITTI dataset and the Waymo Open dataset.
연구 동기 및 목표
- 3D 컨볼루션 백본의 수신 영역이 제한되어 있어 희소하거나 완전하지 않은 3D 객체를 검출하는 데 어려움을 겪는 문제를 해결하기 위해.
- 3D 포인트 클라우드 데이터에서 희소하고 균일하지 않은 분포를 가진 볼록에 대해 비용이 과도하게 증가하지 않는 한계 없이 효과적인 자기주의를 적용하기 위해.
- 기존의 볼록 기반 3D 검출기들에 쉽게 통합될 수 있는 일반 목적의 트랜스포머 기반 백본을 설계하기 위해.
- 검출 정확도를 크게 향상시키면서도 3D 컨볼루션 대비 계산 효율성과 낮은 지연을 유지하기 위해.
제안 방법
- 빈 볼록 위치와 비어 있지 않은 볼록 위치에서 각각 효율적으로 작동하는 희소 볼록 모듈과 서브맨포ลด 볼록 모듈을 제안하여 희소 어텐션 연산을 가능하게 한다.
- 각 볼록의 효과적 수신 영역을 확장하면서도 쿼리당 참조하는 볼록 수를 제한하기 위해 국소 어텐션(Local Attention)과 희석된 어텐션(Dilated Attention) 메커니즘을 도입한다.
- 희소 텐서 연산을 사용해 관련 볼록 특징을 효율적으로 검색함으로써 다중 헤드 어텐션의 속도를 높이는 빠른 볼록 쿼리(Fast Voxel Query)를 활용한다.
- VoTr 모듈에서 선형 투영 레이어를 사용해 모델 파라미터를 최소화하여 3D 컨볼루션 백본 대비 0.5M의 파라미터 감소를 달성한다.
- 다중 헤드 자기주의를 사용하여 각 볼록이 큰 공간 범위에 걸쳐 먼 거리에 위치한 의미적으로 관련 있는 볼록에 주목할 수 있도록 동적 어텐션 가중치를 적용한다.
- 대부분의 기존 볼록 기반 검출기들인 SECOND 및 PV-RCNN에 쉽게 통합될 수 있도록 아키텍처를 설계하여 일관된 성능 향상을 가능하게 한다.

실험 결과
연구 질문
- RQ13D 컨볼루션의 수신 영역이 제한되어 있어 성능이 저하되는 희소한 3D 볼록 격자에서 트랜스포머 기반 백본이 장거리 공간적 의존성을 효과적으로 포착할 수 있는가?
- RQ2표준 트랜스포머가 밀도 높은 격자에서 과도한 계산 비용을 유발하지 않도록, 희소한 볼록 데이터에 대해 자기주의를 효율적으로 적용할 수 있는가?
- RQ3장거리 수신 영역 확장을 위해 계산 효율성과의 균형을 고려할 때, 국소 어텐션 대비 희석된 어텐션 등 다양한 어텐션 메커니즘이 어떤가?
- RQ4자기주의를 통합함으로써 장거리 및 희소한 3D 객체, 특히 먼 거리나 소형 객체 검출과 같은 도전적인 상황에서 검출 성능이 얼마나 향상되는가?
- RQ53D 컨볼루션 백본 대비 높은 추론 속도와 낮은 파라미터 수를 유지하면서도 성능을 뛰어나게 할 수 있는가?
주요 결과
- KITTI 데이터셋에서 VoTr-SSD는 3D 컨볼루션 기반 베이스라인 대비 중간 수준의 차량 mAP를 2.29% 향상시키고, 어려운 수준의 차량 mAP를 1.79% 향상시켰다.
- Waymo Open 데이터셋에서 VoTr-SSD는 SECOND 대비 1.05% mAP 향상과 PV-RCNN 대비 3.26% 향상을 달성했으며, 특히 50m-Inf 범위에서 먼 거리 검출 성능이 최대 4.83% 향상되었다.
- 국소 어텐션만을 사용하는 것보다 희석된 어텐션을 사용할 경우 KITTI 검증 세트에서 mAP가 2.79% 향상되어, 장거리 컨텍스트 포착 능력 향상에 효과적임을 입증했다.
- VoTr 모듈에 드롭아웃 레이어를 추가하면 드롭아웃 비율이 0.3일 때 성능이 mAP 기준 8.52% 저하되어, 이 아키텍처에서는 드롭아웃이 해로운 영향을 미침을 시사한다.
- 3D 컨볼루션 백본 대비 0.5M의 파라미터 감소를 달성한 것은 효율적인 선형 투영 덕분이며, 단일 단계 검출기에서 14.65 Hz의 높은 추론 속도를 유지했다.
- 시각화 결과, 볼록이 동적으로 먼 거리에 위치한 의미적으로 관련 있는 볼록에 주목함을 확인하여, 장거리 의존성 모델링 능력이 뛰어남을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.