[논문 리뷰] LMNet: Real-time Multiclass Object Detection on CPU using 3D LiDAR
LMNet는 CPU에서만 3D 라이다 포인트 클라우드를 사용하여 차량, 보행자, 자전거 운전자를 실시간으로 단일 단계로 검출하는 3D 객체 검출 네트워크입니다. 확장된 컨볼루션과 다중 시점 포인트 클라우드 투영을 활용하여 GPU에서는 최대 50 FPS, 인텔 코어 i5 CPU에서는 10 FPS의 성능을 달성하여 실시간 자율 주행 시스템에 적합합니다. 모델과 코드는 오픈소스로 제공됩니다.
This paper describes an optimized single-stage deep convolutional neural network to detect objects in urban environments, using nothing more than point cloud data. This feature enables our method to work regardless the time of the day and the lighting conditions.The proposed network structure employs dilated convolutions to gradually increase the perceptive field as depth increases, this helps to reduce the computation time by about 30%. The network input consists of five perspective representations of the unorganized point cloud data. The network outputs an objectness map and the bounding box offset values for each point. Our experiments showed that using reflection, range, and the position on each of the three axes helped to improve the location and orientation of the output bounding box. We carried out quantitative evaluations with the help of the KITTI dataset evaluation server. It achieved the fastest processing speed among the other contenders, making it suitable for real-time applications. We implemented and tested it on a real vehicle with a Velodyne HDL-64 mounted on top of it. We achieved execution times as fast as 50 FPS using desktop GPUs, and up to 10 FPS on a single Intel Core i5 CPU. The deploy implementation is open-sourced and it can be found as a feature branch inside the autonomous driving framework Autoware. Code is available at: https://github.com/CPFL/Autoware/tree/feature/cnn_lidar_detection
연구 동기 및 목표
- 일般的한 CPU에 배포 가능한 오직 라이다 포인트 클라우드 데이터만을 사용하여 실시간, 다중 클래스 3D 객체 검출 시스템을 개발하는 것.
- 정확도를 희생시키지 않고 고속 추론을 달성하여 자율 주행 시스템에서 실시간 성능을 확보하는 것.
- 다중 시점 투영과 확장된 컨벌루션을 통해 3D 포인트 클라우드를 처리하는 경량 단일 단계 CNN 아키텍처를 설계하는 것.
- 벨로시티 HDL-64E 라이다를 장착한 실제 차량에 네트워크를 구현하고 검증하는 것.
- 사전 학습된 모델과 추론 코드를 오픈소스로 제공하여 더 넓은 연구 및 구현 활용을 가능하게 하는 것.
제안 방법
- 네트워크는 범위, 반사율, 그리고 x, y, z 좌표를 포함한 다섯 채널의 비구조적 포인트 클라우드 표현을 2차원 시점도로 투영하여 입력으로 사용합니다.
- 확장률이 점차 증가하는 (1, 1, 2, 4, 8, 16, 32) 맞춤형 확장 컨볼루션 레이어 스택을 사용하여 수용 영역을 점진적으로 확장하면서 계산량을 감소시킵니다.
- 각 포인트에 대해 객체 존재 지도와 3D 경계 상자 오프셋 예측을 출력하여 개별 포인트의 분류 및 회귀를 가능하게 합니다.
- 일반화 성능 향상과 과적합 방지를 위해 훈련 중 드롭아웃 전략과 데이터 증강 기법을 적용합니다.
- 인텔 MKL를 통한 인텔 CPU 최적화를 고려한 Caffe 파생 버전을 사용하여 일반 하드웨어에서 효율적인 추론을 구현합니다.
- 입력 전처리는 PCL과 OpenCV를 이용한 포인트 클라우드 투영을 포함하며, 출력은 비최대 억제를 통해 후처리되어 최종 검출 결과를 도출합니다.

실험 결과
연구 질문
- RQ1일반적인 CPU에서 오직 라이다 포인트 클라우드 데이터만을 사용하여 단일 단계 CNN이 실시간 3D 다중 클래스 객체 검출을 달성할 수 있는가?
- RQ2확장된 컨벌루션 아키텍처는 정확도를 희생시키지 않고 3D 객체 검출에서 추론 속도와 수용 영역 커버리지에 어떻게 기여하는가?
- RQ3실제 환경 데이터에서의 모델 성능은 KITTI와 같은 벤치마크 데이터셋과 비교해 볼 때 어떻게 되는가?
- RQ4소비자용 하드웨어에서 30ms 이내의 추론 시간을 유지하면서도 높은 검출 정확도를 유지도 가능한가?
- RQ5다중 시점 입력 인코딩(범위, 반사율, 공간 좌표)은 경계 상자 정렬 및 방향 예측에 어떤 영향을 미치는가?
주요 결과
- LMNet는 GTX 1080 GPU에서 50 FPS, 인텔 코어 i5-6600K CPU에서 10 FPS의 추론 속도를 달성하여 일반 하드웨어에서 실시간 성능을 입증했습니다.
- KITTI 데이터셋에서 중간 설정 조건에서 자동차의 평균 정밀도는 15.24%, 보행자는 11.46%, 자전거 운전자는 3.23%를 기록했습니다.
- 확장된 컨벌루션의 사용으로 수용 영역을 최대 127×127로 확장하면서 표준 컨벌루션 대비 약 30%의 계산량 감소를 달성했습니다.
- 테슬라 P40에서 147 FPS(6.8ms 추론 시간)의 성능을 기록하여 다른 최첨단 방법들보다 빠른 속도를 확보했습니다.
- 벨로시티 HDL-64E 라이다를 장착한 실제 차량에서 LMNet는 실시간으로 3D 객체를 정확하게 분류하고 검출하여 구현 가능성과 타당성을 검증했습니다.
- 아utow레에서 오픈소스로 제공된 구현과 사전 학습된 모델 덕분에 재현 가능성과 자율 주행 연구 분야에서의 광범위한 채택이 가능해졌습니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.