[논문 리뷰] LiDAR Data Enrichment Using Deep Learning Based on High-Resolution Image: An Approach to Achieve High-Performance LiDAR SLAM Using Low-cost LiDAR
이 논문은 저비용 센서를 사용하여 고성능 LiDAR SLAM을 구현하기 위해 고해상도 RGB 이미지와 딥러닝 기반 방법을 활용하여 희소한 16채널 LiDAR 포인트 클라우드를 강화하는 방법을 제안한다. ERFNet을 통한 이미지 세분화와 희소 컨volution 신경망을 통한 밀도 높은 포인트 클라우드 예측을 융합함으로써, 포인트 클라우드 복원에서 평균 제곱 오차(MSE)가 1.1m에 도달하였으며, 정확한 SLAM 지도를 유지하면서도 더 높은 해상도의 세부 정보를 제공한다.
LiDAR-based SLAM algorithms are extensively studied to providing robust and accurate positioning for autonomous driving vehicles (ADV) in the past decades. Satisfactory performance can be obtained using high-grade 3D LiDAR with 64 channels, which can provide dense point clouds. Unfortunately, the high price significantly prevents its extensive commercialization in ADV. The cost-effective 3D LiDAR with 16 channels is a promising replacement. However, only limited and sparse point clouds can be provided by the 16 channels LiDAR, which cannot guarantee sufficient positioning accuracy for ADV in challenging dynamic environments. The high-resolution image from the low-cost camera can provide ample information about the surroundings. However, the explicit depth information is not available from the image. Inspired by the complementariness of 3D LiDAR and camera, this paper proposes to make use of the high-resolution images from a camera to enrich the raw 3D point clouds from the low-cost 16 channels LiDAR based on a state-of-the-art deep learning algorithm. An ERFNet is firstly employed to segment the image with the aid of the raw sparse 3D point clouds. Meanwhile, the sparse convolutional neural network is employed to predict the dense point clouds based on raw sparse 3D point clouds. Then, the predicted dense point clouds are fused with the segmentation outputs from ERFnet using a novel multi-layer convolutional neural network to refine the predicted 3D point clouds. Finally, the enriched point clouds are employed to perform LiDAR SLAM based on the state-of-the-art normal distribution transform (NDT). We tested our approach on the re-edited KITTI datasets: (1)the sparse 3D point clouds are significantly enriched with a mean square error of 1.1m MSE. (2)the map generated from the LiDAR SLAM is denser which includes more details without significant accuracy loss.
연구 동기 및 목표
- 자율주행 응용 분야에서 저비용 16채널 LiDAR의 제한된 포인트 클라우드 밀도 문제를 해결하기 위해.
- 명시적인 깊이 레이블이 필요 없이 고해상도 카메라 이미지를 활용하여 희소한 LiDAR 포인트 클라우드를 강화하기 위해.
- 다중모달 융합을 통해 포인트 클라우드 품질을 향상시켜 저비용 센서를 사용한 고성능 LiDAR SLAM을 가능하게 하기 위해.
- 동적 환경에서 계산 비용 증가 없이도 지도의 밀도와 세부 정보를 크게 향상시키면서도 SLAM 정확도를 유지하기 위해.
제안 방법
- 공간적 정렬을 위해 원시 희소 3D 포인트 클라우드를 가이드로 사용하는 ERFNet 기반 세분화 네트워크가 고해상도 RGB 이미지를 처리한다.
- 희소 컨volution 신경망이 입력 희소 LiDAR 데이터에서 밀도 높은 3D 포인트 클라우드를 예측한다.
- 예측된 밀도 높은 포인트 클라우드와 ERFNet 세분화 출력을 융합하기 위한 새로운 다층 컨볼루션 신경망이 기하학적 구조와 의미 정보를 정밀하게 개선한다.
- 개선된 강화된 포인트 클라우드가 최신 기술인 정규분포변환(NDT) 기반 LiDAR SLAM의 입력으로 사용된다.
- 실제 환경에 부합하는 재편집된 KITTI 데이터셋을 사용하여 프레임워크를 훈련 및 평가한다.
- 엔드 투 엔드 학습을 통해 이미지와 LiDAR의 다중모달 데이터를 통합하여 공간 재구성 정밀도를 향상시킨다.
실험 결과
연구 질문
- RQ1고해상도 RGB 이미지는 자율주행 환경에서 16채널 LiDAR 포인트 클라우드의 희소성 문제를 효과적으로 보완할 수 있는가?
- RQ2이미지 사전지식을 활용해 딥러닝이 저비용 LiDAR 데이터의 밀도와 기하학적 정확도를 얼마나 향상시킬 수 있는가?
- RQ3세분화 및 밀도 예측의 융합이 계산 비용 증가 없이도 SLAM 성능 향상에 기여하는가?
- RQ4강화된 포인트 클라우드는 지도의 세부 정보와 환경 표현을 크게 향상시키면서도 SLAM 정확도를 유지할 수 있는가?
주요 결과
- 제안된 방법은 희소한 16채널 LiDAR 데이터에서 밀도 높은 포인트 클라우드를 복원할 때 평균 제곱 오차(MSE)가 1.1m에 도달하였다.
- 강화된 포인트 클라우드 덕분에 더 풍부한 환경 세부 정보를 포함한 더 높은 밀도의 SLAM 지도 생성이 가능했다.
- 낮은 비용의 16채널 LiDAR를 사용함에도 불구하고 SLAM 성능은 안정적이며 정확도 저하가 최소한이었다.
- ERFNet 세분화와 희소 컨볼루션 기반 예측의 융합이 재구성된 포인트 클라우드의 기하학적 정밀도를 크게 향상시켰다.
- 명시적인 깊이 지도 없이도 고해상도 이미지를 효과적으로 활용하여 LiDAR 데이터를 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.