[논문 리뷰] A9 Intersection Dataset: All You Need for Urban 3D Camera-LiDAR Roadside Perception
A9 교차로 데이터셋은 복잡한 도심 교차로에서 도로변 시점으로부터 획득한 4.8만 개의 동기화된 고품질 3D 레이블이 부여된 라이다 포인트 클라우드 및 카메라 이미지를 제공하며, 10개의 객체 클래스에 걸쳐 총 57.4만 개의 수동으로 레이블링된 3D 경계상자(박스)를 포함한다. 이 데이터셋은 캘리브레이션된 다중 센서 융합을 통해 고도화된 3D 인식 연구를 가능하게 하며, 단일 카메라, 라이다, 다중 모odal 기반 3D 객체 검출에 대해 최신 기준 성능을 제공한다. 특히, 음영과 장거리 탐지와 같은 도전적인 상황에서 후기 융합 기반 모델이 뛰어난 성능을 보였다.
Intelligent Transportation Systems (ITS) allow a drastic expansion of the visibility range and decrease occlusions for autonomous driving. To obtain accurate detections, detailed labeled sensor data for training is required. Unfortunately, high-quality 3D labels of LiDAR point clouds from the infrastructure perspective of an intersection are still rare. Therefore, we provide the A9 Intersection Dataset, which consists of labeled LiDAR point clouds and synchronized camera images. Here, we recorded the sensor output from two roadside cameras and LiDARs mounted on intersection gantry bridges. The point clouds were labeled in 3D by experienced annotators. Furthermore, we provide calibration data between all sensors, which allow the projection of the 3D labels into the camera images and an accurate data fusion. Our dataset consists of 4.8k images and point clouds with more than 57.4k manually labeled 3D boxes. With ten object classes, it has a high diversity of road users in complex driving maneuvers, such as left and right turns, overtaking, and U-turns. In experiments, we provided multiple baselines for the perception tasks. Overall, our dataset is a valuable contribution to the scientific community to perform complex 3D camera-LiDAR roadside perception tasks. Find data, code, and more information at https://a9-dataset.com.
연구 동기 및 목표
- 복잡한 도심 교차로 환경에서 고품질의 도로변 시점 3D 라이다 및 카메라 데이터셋이 부족한 문제를 해결하기 위해.
- 지능형 교통 시스템에서 복잡한 3D 인식 작업을 지원하는 종합적이고 캘리브레이션된 다양한 데이터셋을 제공하기 위해.
- 동기화된 라이다, 카메라 및 3D 박스 레이블링과 트랙 ID를 활용한 다중 모달 3D 객체 검출의 견고한 평가를 가능하게 하기 위해.
- 기존 A9 데이터셋을 확장하여 보호가 필요한 도로 이용자(예: 보행자, 자전거 기사 등)가 포함된 교차로 교통 시나리오와 향상된 레이블링 품질을 추가하기 위해.
제안 방법
- 실제 도심 교차로에 설치된 고가교에 고정된 두 대의 도로변 카메라와 여러 대의 라이다를 사용하여 데이터를 수집하였다.
- 경험이 풍부한 레이블러가 라이다 포인트 클라우드 상에서 수동으로 3D 경계상자를 생성하였으며, U턴, 추월, 좌회전 등의 복잡한 운전 행동을 포함하였다.
- 모든 센서 간의 외부 캘리브레이션 행렬을 계산하여 정확한 3D에서 2D 투영 및 다중 센서 융합을 가능하게 하였다.
- 세 가지 인식 기준 성능 모델을 구현하였다: MonoDet3D(단일 카메라 기반 3D 객체 검출), PointPillars(라이다 기반 검출), InfraDet3D(카메라 및 라이다 검출 결과의 후기 융합).
- InfraDet3D 모델은 MonoDet3D와 PointPillars의 검출 결과를 할당 알고리즘(Hungarian algorithm)을 사용해 매칭하고, 신뢰도 기반 융합을 통해 후기 융합을 실현하였다.
- A9-Devkit에 포함된 후처리 스크립트를 통해 다양한 시야각 구성에 맞는 데이터 자르기 및 초기 융합 실험을 지원하였다.

실험 결과
연구 질문
- RQ1카메라와 라이다를 융합한 다중 모달 3D 객체 검출이 복잡한 도심 교차로 환경에서 단일 모달 기반 검출 대비 어떤 성능을 보이는가?
- RQ2단일 카메라 및 라이다 검출기 간의 후기 융합이 다양한 난이도 수준에서 mAP 측정치에서 어떤 성능 향상을 가져오는가?
- RQ3음영, 거리, 포인트 밀도가 도로변 3D 인식 성능에 어떤 영향을 미치는가?
- RQ4고품질 3D 레이블이 부여된 캘리브레이션된 다중 센서 데이터셋이 실제 도심 환경에서 3D 객체 검출 모델의 견고성 향상에 기여하는가?
- RQ5작은 객체나 저조도 조건에서 카메라 기반 검출과 라이다 기반 검출의 상대적 강점은 무엇인가?
주요 결과
- InfraDet3D 후기 융합 모델이 가장 높은 전체 mAP 성능을 기록하여, 카메라와 라이다 검출 결과를 융합함으로써 검출 성능 향상이 뚜렷하게 이루어짐을 입증하였다.
- LiDAR_North 모달이 Easy 난이도 범주에서 가장 높은 mAP 성능을 기록하여, 라이다가 장거리 및 부분적 음영이 없는 상황에서의 강점을 보였다.
- 초기 융합을 적용한 PointPillars가 Moderate 난이도 수준에서 다른 모델보다 뛰어난 성능을 보였으며, 부분적 음영과 중거리 객체에 대한 강력한 내구성을 입증하였다.
- MonoDet3D는 보행자와 같은 작은 객체 검출에서 뛰어난 성능을 보였으며, 단일 카메라 기반 시각 인식의 세밀한 세부 정보 해석 능력이 뛰어남을 시사하였다.
- 초기 융합(LiDAR + 카메라)과 후기 융합(InfraDet3D)의 조합이 모든 난이도 수준에서 일관되고 견고한 성능을 기록하여, 다중 센서 융합의 가치를 입증하였다.
- 10개의 다양한 클래스에 걸쳐 총 57.4만 개의 3D 레이블이 포함된 이 데이터셋은 복잡한 도심 교통 환경에서 인식 시스템의 종합적 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.