Skip to main content
QUICK REVIEW

[논문 리뷰] HDMapNet: An Online HD Map Construction and Evaluation Framework

Qi Li, Yue Wang|arXiv (Cornell University)|2021. 07. 13.
Advanced Image and Video Retrieval Techniques인용 수 8
한 줄 요약

HDMapNet는 차량 내 카메라와/또는 레이저 라이더를 사용하여 실시간으로 고정밀도(HD) 의미 맵을 구축하기 위한 온라인, 센서 기반 프레임워크를 제안한다. 이는 2D 이미지 특징을 베이비즈 아이뷰로 투영하기 위해 새로운 뷰 트랜스포머를 활용하여 벡터화된 맵 예측을 수행한다. 모든 지표에서 이전 방법 대비 50%의 상대적 성능 향상을 달성하였으며, 카메라-레이저 라이더 융합 모델은 인스턴스 검출 및 의미 분할에서 각각 12.1 mAP와 13.1 mAP의 성능 향상을 기록하였다.

ABSTRACT

Constructing HD semantic maps is a central component of autonomous driving. However, traditional pipelines require a vast amount of human efforts and resources in annotating and maintaining the semantics in the map, which limits its scalability. In this paper, we introduce the problem of HD semantic map learning, which dynamically constructs the local semantics based on onboard sensor observations. Meanwhile, we introduce a semantic map learning method, dubbed HDMapNet. HDMapNet encodes image features from surrounding cameras and/or point clouds from LiDAR, and predicts vectorized map elements in the bird's-eye view. We benchmark HDMapNet on nuScenes dataset and show that in all settings, it performs better than baseline methods. Of note, our camera-LiDAR fusion-based HDMapNet outperforms existing methods by more than 50% in all metrics. In addition, we develop semantic-level and instance-level metrics to evaluate the map learning performance. Finally, we showcase our method is capable of predicting a locally consistent map. By introducing the method and metrics, we invite the community to study this novel map learning problem.

연구 동기 및 목표

  • 수동 애너테이션과 유지보수가 요구되는 전통적인 HD 맵 구축 방식의 확장성과 높은 인건비 문제를 해결하기 위해.
  • 사전에 구축된 글로벌 맵이 없이 차량 내 센서 데이터에서 직접 국소적 의미 맵을 학습하는 온라인 실시간 프레임워크를 개발하기 위해.
  • 깊이 불확실성을 다루고 카메라 외부 파rameter를 활용하는 뷰 포지션에서 베이비즈 아이뷰로의 강력한 특징 투영 메커니즘을 설계하기 위해.
  • 의미 수준과 인스턴스 수준의 평가 지표를 모두 사용하여 모델 간 공정한 비교가 가능한 맵 학습 성능 평가를 수행하기 위해.
  • 실시간 운동 계획에 적합한 국소적으로 일관된, 벡터화된 의미 맵 생성의 가능성을 입증하기 위해.

제안 방법

  • HDMapNet는 둘러싼 카메라에서 온 이미지 특징과/또는 레이저 라이더 포인트 클라우드를 처리하기 위해 다중 브랜치 네트워크를 사용하며, 새로운 뷰 트랜스포머를 통해 이를 베이비즈 아이뷰로 투영한다.
  • 뷰 트랜스포머는 신경망 특징 변환과 기하학적 투영을 결합하며, 카메라 외부 파rameter를 명시적으로 모델링하고, 명시적인 깊이 추정이 없이도 암묵적으로 3D 구조를 모델링한다.
  • 특징 융합 모듈은 카메라와 레이저 라이더의 표현을 결합하여 상호 보완적인 강점을 활용한다 — 카메라는 질감과 색상 대비를, 레이저 라이더는 고도 변화에서 기하학적 정밀도를 제공한다.
  • 의미 분할, 인스턴스 검출, 방향 분류를 위한 별도의 헤드를 통해 맵 요소(예: 차선, 분리선, 보행자 횡단보도)의 벡터화된 예측을 수행한다.
  • 시간적 융합은 자동차의 자세 정보를 기반으로 프레임 간 특징을 연결하여 시간에 걸쳐 안정성과 일관성을 향상시킨다.
  • 후처리 단계에서는 주성분 분석(PCA)과 방향 마스크를 사용하여 예측된 임bedding을 부드럽고 연속적인 벡터 곡선으로 변환한다.
Figure 1 : In contrast to pre-annotating global semantic maps, we introduce a novel local map learning framework that makes use of on-board sensors to estimate local semantic maps.
Figure 1 : In contrast to pre-annotating global semantic maps, we introduce a novel local map learning framework that makes use of on-board sensors to estimate local semantic maps.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 실시간으로 원시 카메라 및 레이저 라이더 입력에서 직접 HD 의미 맵을 효과적으로 예측할 수 있는가?
  • RQ2기존의 IPM 또는 깊이 추정 기반 방법과 비교해 본다면, 제안된 뷰 트랜스포머의 정확도와 견고성은 어떠한가?
  • RQ3카메라와 레이저 라이더 모odalities가 서로 다른 맵 요소를 예측하는 데 얼마나 상호 보완적인가?
  • RQ4여러 프레임의 시간적 융합이 동적인 환경이나 저조도 조건에서 맵의 일관성 향상과 노이즈 감소에 기여하는가?
  • RQ5의미 수준과 인스턴스 수준의 평가 지표가 함께 작용할 때 맵 학습 모델의 성능을 어떻게 반영하는가?

주요 결과

  • 카메라-레이저 라이더 융합 기반의 HDMapNet은 모든 지표에서 이전 방법 대비 50% 이상의 성능 향상을 기록하였으며, 의미 분할에서 12.1 mAP, 인스턴스 검출에서 13.1 mAP의 성능 향상을 달성하였다.
  • HDMapNet(Surr)는 IPM 및 Lift-Splat-Shoot와 같은 단일 모odal 기반의 모든 베이스라인을 초월하였으며, 인스턴스 검출에서 mAP 기준 55.4%의 상대적 향상을 기록하였다.
  • 악천후 조건에서도 합리적인 성능 유지를 보였으며, 비 오는 조건에서는 IoU가 38.7로 떨어졌고 야간 조건에서는 39.3로 떨어졌지만, 여전히 완전한 차선 예측을 생성하였다.
  • 두 개 이상의 프레임을 시간적으로 융합함으로써 IoU는 32.9에서 36.4로 향상되었으며, 장기적인 누적은 시간이 지남에 따라 더 큰 일관성 있는 의미 맵을 생성하였다.
  • CD(중심 거리) 지표는 상호 보완적인 행동을 드러내었는데, 일부 모델은 정밀도(CD P)에서 뛰어나고, 다른 일부는 재현율(CD L)에서 뛰어나며, HDMapNet(Surr)는 가장 균형 잡힌 성능을 기록하였다.
  • 시각화 결과는 모델이 인스턴스 수준의 임bedding과 방향 인식 특징을 학습하고 있으며, 계획에 적합한 부드럽고 연속적인 벡터 곡선을 생성함을 확인하였다.
Figure 2 : Model overview. HDMapNet works with either or both of images and point clouds, outputs semantic segmentation, instance embedding and directions, and finally produces a vectorized local semantic map. Top left: image branch. Bottom left: point cloud branch. Right: HD semantic map. .
Figure 2 : Model overview. HDMapNet works with either or both of images and point clouds, outputs semantic segmentation, instance embedding and directions, and finally produces a vectorized local semantic map. Top left: image branch. Bottom left: point cloud branch. Right: HD semantic map. .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.