Skip to main content
QUICK REVIEW

[논문 리뷰] PI-RCNN: An Efficient Multi-sensor 3D Object Detector with Point-based Attentive Cont-conv Fusion Module

Liang Xie, Chao Xiang|arXiv (Cornell University)|2019. 11. 14.
Advanced Neural Network Applications참고 문헌 26인용 수 9
한 줄 요약

이 논문은 RGB 이미지와 LiDAR 포인트 클라우드 특징을 새로운 Point-based Attentive Cont-conv Fusion (PACF) 모듈을 통해 융합하는 다중 센서 3D 객체 검출기인 PI-RCNN을 제안한다. 이 모듈은 포인트별 풀링과 주의 집중형 통합을 통해 3D 포인트에 직접 연속 컨볼루션을 적용한다. 이 방법은 KITTI 3D 검출 벤치마크에서 최신 기술 수준의 성능을 달성하여 이전 방법보다 3D AP에서 뛰어난 성능을 보였다.

ABSTRACT

LIDAR point clouds and RGB-images are both extremely essential for 3D object detection. So many state-of-the-art 3D detection algorithms dedicate in fusing these two types of data effectively. However, their fusion methods based on Birds Eye View (BEV) or voxel format are not accurate. In this paper, we propose a novel fusion approach named Point-based Attentive Cont-conv Fusion(PACF) module, which fuses multi-sensor features directly on 3D points. Except for continuous convolution, we additionally add a Point-Pooling and an Attentive Aggregation to make the fused features more expressive. Moreover, based on the PACF module, we propose a 3D multi-sensor multi-task network called Pointcloud-Image RCNN(PI-RCNN as brief), which handles the image segmentation and 3D object detection tasks. PI-RCNN employs a segmentation sub-network to extract full-resolution semantic feature maps from images and then fuses the multi-sensor features via powerful PACF module. Beneficial from the effectiveness of the PACF module and the expressive semantic features from the segmentation module, PI-RCNN can improve much in 3D object detection. We demonstrate the effectiveness of the PACF module and PI-RCNN on the KITTI 3D Detection benchmark, and our method can achieve state-of-the-art on the metric of 3D AP.

연구 동기 및 목표

  • Bird's Eye View (BEV) 또는 벽체 기반 융합에 의존하는 기존 3D 객체 검출기의 한계를 해결하기 위해, 양자화와 시각적 불일치로 인한 정밀도 손실을 방지하고자 한다.
  • LiDAR 포인트 클라우드의 흐릿함과 의미 정보 부족 문제를 보완하면서도 RGB 이미지의 풍부한 의미 정보를 활용하여 3D 객체 검출 성능을 향상시키고자 한다.
  • 2D로 변환된 표현이 아닌 3D 포인트 그 자체에 기반한 융합 메커니즘을 설계하여 공간 정확도를 유지하고 더 나은 특징 통합을 가능하게 하고자 한다.
  • 다중 작업 학습을 통해 세그멘테이션 보조 네트워크와 3D 검출 보조 네트워크를 함께 훈련시켜 특징 표현력을 향상시키고 검출 성능을 향상시키고자 한다.

제안 방법

  • 원시 3D LiDAR 포인트에 직접 연속 컨볼루션을 적용하여 LiDAR 및 RGB 입력의 특징을 융합하는 Point-based Attentive Cont-conv Fusion (PACF) 모듈을 제안한다.
  • 이웃 포인트의 특징을 집계하기 위해 Point-Pooling 연산을 통합하여 흐릿한 포인트 분포에 대한 강건성을 향상시킨다.
  • 다양한 모odalities의 특징 중요도를 학습하는 주의 집중형 통합 메커니즘을 적용하여 융합의 표현력을 향상시킨다.
  • PI-RCNN를 이중 스트림 네트워크로 설계한다: 하나의 스트림은 경량의 완전 컨volutional 세그멘테이션 네트워크를 통해 RGB 이미지를 처리하여 고해상도 의미 맵을 생성하고, 다른 하나는 원시 LiDAR 포인트를 처리하여 3D 프포절을 생성한다.
  • 검출 네트워크의 중간 단계에서 두 스트림의 특징을 PACF 모듈을 통해 융합하여 맥락 인식 특징 학습을 가능하게 한다.
  • 3D 객체 애너테이션만을 사용하여 전체 네트워크를 엔드 투 엔드로 훈련시키며, 의미 세그멘테이션 데이터를 활용한 세그멘테이션 보조 네트워크의 사전 훈련을 선택적으로 수행하여 특징 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1BEV 기반 또는 벽체 기반 융합 방법과 비교해, 3D 포인트에 직접 다중 센서 특징을 융합하는 것이 3D 객체 검출 정확도 향상에 기여하는가?
  • RQ2포인트 기반 네트워크에서 이미지 의미 세그멘테이션을 다중 작업 헤드로 통합하면 3D 객체 검출 성능 향상에 기여하는가?
  • RQ3검출 네트워크 내에서 융합 위치(조기 vs 중간 단계)의 선택이 검출 성능에 어떤 영향을 미치는가?
  • RQ4세그멘테이션 네트워크의 다양한 특징 추출 레이어가 최종 3D 검출 정확도에 미치는 영향은 어떠한가?
  • RQ53D 객체 애너테이션만 존재할 때, 세그멘테이션 보조 네트워크를 의미 세그멘테이션 데이터로 사전 훈련하는 것이 얼마나 효과적인가?

주요 결과

  • PACF 모듈은 주의 집중형 연속 컨볼루션을 통해 포인트별 특징 융합을 가능하게 하여 표준 BEV 기반 융합 방법보다 뛰어난 성능을 달성한다.
  • PI-RCNN는 KITTI 3D 검출 벤치마크에서 최신 기술 수준의 3D 평균 정확도(AP)를 달성하여 검증 및 테스트 분할 모두에서 이전 방법을 능가한다.
  • 제거 분석 결과, 연속 컨볼루션에 적합한 수용 영역 크기로 K=3이 최적임을 확인하였으며, 더 큰 K 값은 먼 거리의 포인트로부터 노이즈를 유발함을 확인하였다.
  • PACF에 Point-Pooling과 Attentive Aggregation을 추가함으로써 성능 향상이 명백하게 나타나, 이들이 특징 정제에 효과적임을 입증하였다.
  • 검출 네트워크의 중간 단계에서 특징을 융합하는 것(V1)이 조기 융합(V2)보다 더 우수한 결과를 내어, 중간 수준의 특징이 융합에 더 적합함을 시사한다.
  • 단일 클래스 학습보다 다중 클래스 세그멘테이션 감독을 사용한 경우 더 뛰어난 성능을 기록하였으며, 배경 및 환경 이해를 위한 더 풍부한 맥락 사전 지식을 제공함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.