Skip to main content
QUICK REVIEW

[논문 리뷰] FusionLane: Multi-Sensor Fusion for Lane Marking Semantic Segmentation Using Deep Neural Networks

Ruochen Yin, Biao Yu|arXiv (Cornell University)|2020. 03. 09.
Advanced Neural Network Applications참고 문헌 21인용 수 7
한 줄 요약

이 논문은 레이저 라이다(LIDAR) 포인트 클라우드 비드아이뷰(LBEV)와 카메라 이미지 특징을 융합하여 정확한 차선 마킹 세분화를 위한 새로운 딥러닝 프레임워크인 FusionLane을 제안한다. 디플랩V3+ 백본과 시간적 맥락을 활용하기 위한 LSTM 모듈, 이중 브랜치 인코더-디코더 아키텍처를 결합함으로써, 14,000개 이상의 레이블이 부여된 프레임으로 구성된 자체 구축 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 기준 모델 대비 평균 교차율(mIoU)이 16.39% 높다.

ABSTRACT

It is a crucial step to achieve effective semantic segmentation of lane marking during the construction of the lane level high-precision map. In recent years, many image semantic segmentation methods have been proposed. These methods mainly focus on the image from camera, due to the limitation of the sensor itself, the accurate three-dimensional spatial position of the lane marking cannot be obtained, so the demand for the lane level high-precision map construction cannot be met. This paper proposes a lane marking semantic segmentation method based on LIDAR and camera fusion deep neural network. Different from other methods, in order to obtain accurate position information of the segmentation results, the semantic segmentation object of this paper is a bird's eye view converted from a LIDAR points cloud instead of an image captured by a camera. This method first uses the deeplabv3+ [ ef{ref:1}] network to segment the image captured by the camera, and the segmentation result is merged with the point clouds collected by the LIDAR as the input of the proposed network. In this neural network, we also add a long short-term memory (LSTM) structure to assist the network for semantic segmentation of lane markings by using the the time series information. The experiments on more than 14,000 image datasets which we have manually labeled and expanded have shown the proposed method has better performance on the semantic segmentation of the points cloud bird's eye view. Therefore, the automation of high-precision map construction can be significantly improved. Our code is available at https://github.com/rolandying/FusionLane.

연구 동기 및 목표

  • 고정밀 지ap 구축을 위한 카메라 기반 세분화에서의 정확한 3차원 공간 위치 정보 부족 문제를 해결하기 위해.
  • 항공사진 또는 카메라 기반 이미지가 왜곡, 척도 문제, 배경 혼잡으로 인해 악영향을 받는 문제를 극복하기 위해.
  • 라이다의 기하학적 정밀도와 카메라 이미지의 풍부한 텍스처를 활용하여 차선 마킹 세분화를 위한 다중 센서 융합 프레임워크를 개발하기 위해.
  • 정확하고 3차원 인식된 세분화 예측을 제공함으로써, 끝에서 끝까지 자동화된 레일 수준 고정밀 지도 구축을 가능하게 하기 위해.

제안 방법

  • 이 방법은 라이다에서 유도된 비드아이뷰(LBEV) 포인트 클라우드와 카메라 이미지 특징을 모두 처리하는 이중 브랜치 인코더-디코더 신경망을 사용한다.
  • 카메라 이미지는 먼저 비드아이뷰(CBEV)로 변환되고, 사전 학습된 디플랩V3+ 네트워크를 사용하여 세분화된다.
  • 카메라 브랜치의 세분화 결과는 스트라이드=2인 컨볼루션 연산을 거친 후 LBEV 특징 맵과 융합된다.
  • 연속 프레임 간의 시간적 의존성을 모델링하기 위해 LSTM 모듈이 통합되어 세분화의 시간에 따른 안정성을 향상시킨다.
  • 디코더는 인코더의 스킵 커넥션을 활용한 두 단계의 이중선형 업샘플링을 사용하여 세밀한 세부 사항을 복구한다.
  • 최종 출력은 LBEV에 대한 다중 클래스 세분화 맵이며, 각 레이블이 부여된 차선 마킹에 대해 정확한 3차원 공간 좌표를 제공한다.

실험 결과

연구 질문

  • RQ1카메라 기반 이미지에 비해, 라이다에서 유도된 비드아이뷰(LBEV)가 차선 마킹 세분화에 더 정확한 3차원 공간 위치 정보를 제공할 수 있는가?
  • RQ2카메라 이미지 특징과 라이다 포인트 클라우드 특징의 융합이 차선 마킹 세분화 정확도 향상에 얼마나 효과적인가?
  • RQ3LSTM을 통한 시간적 맥락 통합이 연속 프레임 간 세분화 안정성과 정확도 향상에 어느 정도 기여하는가?
  • RQ4제안된 다중 센서 융합 프레임워크가 단일 센서 기반 기준 모델(Camera-only 또는 LIDAR-only)에 비해 mIoU 및 클래스별 성능 측면에서 뛰어난가?

주요 결과

  • FusionLane 모델은 타임스텝 4일 때 평균 교차율(mIoU)이 85.35%를 기록하여 기준 모델인 수정된 디플랩V3+보다 16.39%포인트 높게 성능을 내었다.
  • LSTM이 통합된 모델(FusionLane_FcLSTM)이 모든 변종 중에서 가장 높은 mIoU를 기록하여 시간적 모델링의 효과를 입증하였다.
  • mIoU는 타임스텝 4에서 최고로 떨어지며 이후 증가함에 따라 감소함을 확인하여 과도한 이전 맥락은 성능 저하를 초래할 수 있음을 시사하였다.
  • 화살표(Arrow) 클래스를 제외한 대부분의 차선 마킹 클래스에서 뛰어난 성능을 보였으며, 화살표 클래스의 IOU는 약간 감소했으나 국소적 특징 손실로 인한 것으로 분석되었다.
  • 픽셀 정확도는 높았지만(91.31%) 클래스 불균형으로 인해 오해의 소지가 있었으며, 배경 클래스가 데이터셋에서 지배적이었기 때문에 mIoU가 주요 평가 지표로 중요한 이유를 강조하였다.
  • 제거 실험을 통해 라이다-카메라 융합에 시간적 모델링을 통합한 것이 단일 센서 또는 비시간적 접근보다 세분화 품질 향상에 크게 기여한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.