Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Urban-scale Point Clouds Segmentation with BEV Projection

Zhenhong Zou, Yizhe Li|arXiv (Cornell University)|2021. 09. 19.
3D Shape Modeling and Analysis참고 문헌 30인용 수 9
한 줄 요약

이 논문은 도심 규모 포인트 클라우드의 효율적인 3D 세분화를 위한 BEV 투영 기반 방법을 제안한다. 희박한 3D 데이터를 조밀한 베이비즈 아이 sight(鳥瞰)도 이미지로 변환하여 2D 컨볼루션 신경망과 주목력 기반 다중 모odal 융합 네트워크를 활용한다. 이 방법은 SensatUrban 데이터셋에서 61.17% mIoU와 91.37% 전체 정확도를 달성하여 대규모 도심 포인트 클라우드에서 최신 기술 수준의 효율성과 성능을 입증한다.

ABSTRACT

Point clouds analysis has grasped researchers' eyes in recent years, while 3D semantic segmentation remains a problem. Most deep point clouds models directly conduct learning on 3D point clouds, which will suffer from the severe sparsity and extreme data processing load in urban-scale data. To tackle the challenge, we propose to transfer the 3D point clouds to dense bird's-eye-view projection. In this case, the segmentation task is simplified because of class unbalance reduction and the feasibility of leveraging various 2D segmentation methods. We further design an attention-based fusion network that can conduct multi-modal learning on the projected images. Finally, the 2D out are remapped to generate 3D semantic segmentation results. To demonstrate the benefits of our method, we conduct various experiments on the SensatUrban dataset, in which our model presents competitive evaluation results (61.17% mIoU and 91.37% OverallAccuracy). We hope our work can inspire further exploration in point cloud analysis.

연구 동기 및 목표

  • 도심 규모 3D 포인트 클라우드 세분화에서 발생하는 데이터 희박성과 높은 계산 부담 문제를 해결하기 위해.
  • 희박한 3D 포인트 클라우드를 조밀한 2D BEV 투영도로 변환하여 세분화 성능을 향상시키기 위해.
  • RGB와 기하학적(고도) 특징을 주목력 기반 융합 네트워크를 통해 다중 모달 특징을 활용하여 세분화 성능을 향상시키기 위해.
  • 투영된 이미지에 기반한 기존 2D 세분화 아키텍처를 활용하여 학습 및 추론의 효율성을 높이기 위해.
  • 실제 도시 환경의 대규모 SensatUrban 데이터셋에서의 성능을 검증하여 경쟁력 있는 성능을 입증하기 위해.

제안 방법

  • 25×25m² 격자 해상도와 20× 확대 비율을 갖춘 고유의 투영 알고리즘을 사용하여 3D 포인트 클라우드를 조밀한 베이비즈 아이사이트(鳥瞰)도 이미지로 변환한다.
  • 투영된 BEV 이미지에서 RGB 및 기하학적(고도) 특징을 융합하는 다중 모달 주목력 기반 융합 네트워크를 적용한다.
  • ResNet-34, ResNet-101, HRNet 백본을 사용하는 2D 세분화 모델(예: UNet, Deeplabv3, OCRNet)을 투영된 이미지에 적용한다.
  • x/y 좌표를 사용하여 2D 세분화 예측 결과를 3D 공간으로 다시 매핑하여 3D 세분화 레이블을 생성한다.
  • 데이터셋의 장우도 클래스 분포를 처리하기 위해 로그 역수 가중치를 적용한 클래스 균형 잠재 손실 함수를 사용한다.
  • 입력 해상도 500×500, 배치 크기 8로, CUDA 가속 기반 PyTorch를 사용하여 두 대의 RTX 3090 GPU에서 학습한다.

실험 결과

연구 질문

  • RQ1BEV 투영이 도심 규모 3D 포인트 클라우드 세분화에서 데이터 희박성과 계산 부담을 효과적으로 줄일 수 있는가?
  • RQ2다중 모달 특징이 포함된 BEV 투영 포인트 클라우드에 2D 세분화 모델을 적용했을 때 성능은 어느 정도인가?
  • RQ3RGB와 기하학적 특징의 주목력 기반 융합이 대규모 도시 데이터셋에서 세분화 정확도를 어느 정도 향상시키는가?
  • RQ4SensatUrban 벤치마크에서 기존의 3D 포인트 기반 및 볼륨 기반 모델과 비교해 본다면, 제안된 방법은 성능 및 효율성 면에서 어떤가?
  • RQ5소형 또는 희박한 물체(예: 자전거, 난간 등)를 세분화하는 데 있어 BEV 접근법의 한계는 무엇인가?

주요 결과

  • 제안된 BEV 투영 방법은 SensatUrban 데이터셋에서 61.17% mIoU와 91.37% 전체 정확도를 달성하여 대규모 도시 포인트 클라우드에서 뛰어난 성능을 보였다.
  • OCRNet-HRNet 백본이 61.17%의 최고 mIoU를 기록하여 UNet-ResNet34 및 Deeplabv3-ResNet101와 같은 다른 백본들보다 뛰어난 성능을 보였다.
  • 이 방법은 클래스 불균형 문제를 효과적으로 완화하고 2D 세분화 모델의 효율적 활용을 가능하게 하여 직접 3D 처리에 비해 계산 오버헤드를 크게 감소시켰다.
  • 자전거나 난간과 같은 소형 물체는 BEV 투영에서 픽셀 수가 극히 적어 해상도 민감도의 한계로 인해 여전히 도전 과제로 남아 있다.
  • 다양한 도시 환경에서 잘 일반화되며, 건물(91.37% OA), 도로(94.40% OA), 물(74.46% OA) 등의 주요 클래스에서 뛰어난 성능을 보였다.
  • 시각화 결과는 이 방법이 세밀한 디테일을 유지하고 복잡한 구조물(예: 屋根, 보도 등)을 정확하게 세분화함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.