[논문 리뷰] 3D Visual Perception for Self-Driving Cars using a Multi-Camera System: Calibration, Mapping, Localization, and Obstacle Detection
이 논문은 네 개의 피시아이언 카메라 시스템을 사용하여 자율 주행 차량을 위한 완전한 시각적 3D 인식 파이프라인을 제시한다. 이는 최소한의 겹침으로 360° 전방위 커버리지를 가능하게 하며, 투영 왜곡을 방지하고 시야를 유지하면서도 높은 정확도와 실시간 성능을 확보한 단일 GPU에서 실시간으로 정밀한 校정, 희박한 및 조밀한 3D 매핑, 실시간 시각적 국소화, 10cm 이내의 장애물 탐지가 가능하다. 이는 왜곡이 제거된 피시아이언 이미지를 직접 처리함으로써 투영 모델로의 편평화를 피하고, 전체 시야를 유지한다.
Cameras are a crucial exteroceptive sensor for self-driving cars as they are low-cost and small, provide appearance information about the environment, and work in various weather conditions. They can be used for multiple purposes such as visual navigation and obstacle detection. We can use a surround multi-camera system to cover the full 360-degree field-of-view around the car. In this way, we avoid blind spots which can otherwise lead to accidents. To minimize the number of cameras needed for surround perception, we utilize fisheye cameras. Consequently, standard vision pipelines for 3D mapping, visual localization, obstacle detection, etc. need to be adapted to take full advantage of the availability of multiple cameras rather than treat each camera individually. In addition, processing of fisheye images has to be supported. In this paper, we describe the camera calibration and subsequent processing pipeline for multi-fisheye-camera systems developed as part of the V-Charge project. This project seeks to enable automated valet parking for self-driving cars. Our pipeline is able to precisely calibrate multi-camera systems, build sparse 3D maps for visual navigation, visually localize the car with respect to these maps, generate accurate dense maps, as well as detect obstacles based on real-time depth map extraction.
연구 동기 및 목표
- 카메라만을 사용하여 저비용, 고정밀도의 3D 시각 인식 파이프라인을 자율 주차 주행을 위해 개발한다.
- 피시아이언 렌즈를 사용하여 최소한의 카메라 겹침으로 360° 환경 인식을 가능하게 한다.
- 이미지의 투영 모델로의 왜곡을 피하여 전체 시야를 유지하고 왜곡 관련 정보 손실을 줄인다.
- 다중 카메라 시스템을 사용하여 실시간 성능을 확보하면서 장애물 탐지, 국소화 및 매핑을 수행한다.
- 저속 자율 주행 작업을 위한 순수 시각적 다중 피시아이언 시스템의 실현 가능성을 입증한다.
제안 방법
- 시스템은 차량의 휠 오도메트리 기준으로 각 피시아이언 카메라의 외부 파rameter를 추정하기 위해 다중 프레임 간의 2D-3D 특징 대응을 활용하는 구조 기반 校정 방법을 사용한다.
- 자기 운동 추정은 모든 카메라의 운동을 동시에 최적화하는 다중 카메라 공식을 사용하여 개별 카메라 처리보다 일관성과 정확도를 향상시킨다.
- 희박한 3D 매핑은 특징 기반 SLAM을 통해 구축되며, 조밀한 3D 매핑은 새로운 고도 맵 융합 기법을 사용해 다중 피시아이언 카메라의 깊이 맵을 융합하여 생성된다.
- 교정된 다중 카메라 설정을 통해 피시아이언 이미지에서 직접 깊이 맵을 추정함으로써 투영 모델로의 왜곡을 피한다.
- 장애물 탐지는 깊이 맵에서 점유 그리드를 생성하고 레이를 따라 장애물을 추출하며, 시간과 카메라 간 융합을 통해 노이즈를 감소시켜 2D에서 수행된다.
- 모든 처리 과정은 GPU 가속을 통해 최적화되어 단일 NVIDIA GTX 680에서 12.5Hz 성능을 달성한다.
실험 결과
연구 질문
- RQ1최소한의 겹침으로 다중 피시아이언 카메라 시스템이 투영 모델로의 왜곡 없이 360° 환경 인식을 수행할 수 있는가?
- RQ2외부 인프라 없이 정확하고 효율적으로 다중 카메라 校정을 수행할 수 있는 방법은 무엇인가?
- RQ3강한 왜곡을 가진 다중 피시아이언 카메라의 깊이 맵 융합을 통해 신뢰할 수 있는 조밀한 3D 매핑을 생성할 수 있는가?
- RQ4피시아이언 카메라 데이터만을 사용하여 고정밀도로 실시간 장애물 탐지를 달성할 수 있는가?
- RQ5저속 주행 조건에서 다섯 카메라 피시아이언 시스템을 통해 시각적 국소화 및 매핑을 얼마나 견고하게 수행할 수 있는가?
주요 결과
- 구조 기반 校정 방법은 특수 캘리브레이션 타겟이나 인프라가 필요 없이 다중 프레임 간의 2D-3D 특징 대응만으로도 높은 정확도와 재현성을 확보한다.
- 모든 카메라 간 기하학적 일관성을 강제하는 다중 카메라 공식을 사용하여 정밀한 시각적 국소화 및 매핑이 가능하다.
- 밀도 높은 고도 맵 융합 기법을 통해 겹침이 최소한인 다중 피시아이언 카메라의 데이터를 융합하여 정확하고 일관된 3D 모델을 생성한다.
- 단일 GPU에서 12.5Hz로 실시간으로 실행되며, 장애물 지도의 시간적 및 공간적 융합을 통해 노이즈를 감소시켜 10cm 이내의 오차를 달성한 장애물 탐지 성능을 확보한다.
- 피시아이언 이미지를 투영 모델로의 왜곡 없이 처리함으로써 전체 시야를 유지하고, 더 높은 사용 가능한 해상도와 정보량을 유지한다.
- 전체 시스템은 실제 실내 주차 환경에서 구현되어 자율 주차 및 저속 주행 조건에서의 자동 충전의 실현 가능성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.