[논문 리뷰] Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting
Argoverse 2는 자율주행의 인지 및 예측을 위한 Sensor, Lidar, Motion Forecasting의 세 가지 대규모 데이터셋과 풍부한 HD 지도 및 다양한 도시 세트를 도입하여 3D 탐지, 자기지도 학습, 다중 에이전트 예측을 향상시킨다.
We introduce Argoverse 2 (AV2) - a collection of three datasets for perception and forecasting research in the self-driving domain. The annotated Sensor Dataset contains 1,000 sequences of multimodal data, encompassing high-resolution imagery from seven ring cameras, and two stereo cameras in addition to lidar point clouds, and 6-DOF map-aligned pose. Sequences contain 3D cuboid annotations for 26 object categories, all of which are sufficiently-sampled to support training and evaluation of 3D perception models. The Lidar Dataset contains 20,000 sequences of unlabeled lidar point clouds and map-aligned pose. This dataset is the largest ever collection of lidar sensor data and supports self-supervised learning and the emerging task of point cloud forecasting. Finally, the Motion Forecasting Dataset contains 250,000 scenarios mined for interesting and challenging interactions between the autonomous vehicle and other actors in each local scene. Models are tasked with the prediction of future motion for "scored actors" in each scenario and are provided with track histories that capture object location, heading, velocity, and category. In all three datasets, each scenario contains its own HD Map with 3D lane and crosswalk geometry - sourced from data captured in six distinct cities. We believe these datasets will support new and existing machine learning research problems in ways that existing datasets do not. All datasets are released under the CC BY-NC-SA 4.0 license.
연구 동기 및 목표
- 다양하고 도전적인 데이터 시나리오를 통해 안전하고 신뢰할 수 있는 자율주행을 촉진한다.
- HD 지도와 풍부한 주석을 갖춘 세 가지 데이터셋(Sensor, Lidar, Motion Forecasting)을 제공하여 인지 및 예측 과제를 지원한다.
- 대규모이고 다양한 데이터로 3D 물체 탐지, 포인트 클라우드 예측, 다중 에이전트 운동 예측 연구를 가능하게 한다.
제안 방법
- AV2 Sensor 데이터셋을 도입하여 1,000개의 장면, 7개의 카메라, 스테레오 영상, 2개의 라이더, 3D 직육면체를 26개 카테고리와 30개 클래스에 대해 제공한다.
- AV2 Lidar 데이터셋을 도입하여 20,000개의 비라벨링 시퀀스와 맵 정렬 포즈를 통해 자기지도 학습 및 포인트 클라우드 예측을 지원한다.
- AV2 Motion Forecasting 데이터셋을 도입하여 다양한 상호작용을 위해 채굴된 250,000개의 시나리오를 각 시나리오에 로컬 맵과 11초의 트랙 이력을 포함하여 다중 주체 예측에 활용한다.
- 지도 정보가 반영된 인지 및 예측을 지원하기 위해 3D 차선 기하학, 주행 가능 영역, 고해상도 지면 높이를 포함한 시나리오별 HD 맵을 제공한다.
- 데이터셋 유용성을 검증하기 위해 3D 물체 탐지, 포인트 클라우드 예측, 운동 예측에 대한 베이스라인 실험을 제공한다.
실험 결과
연구 질문
- RQ1더 크고 다양한 계층 분류 체계와 장거리 객체 표현이 자율주행 인지 및 예측 모델을 어떻게 개선할 수 있는가?
- RQ2HD 맵과 시나리오별 맵이 인지 및 예측의 정확도와 일반화에 어떤 이점을 제공하는가?
- RQ3대규모 LiDAR 데이터셋에서의 자기지도 학습이 포인트 클라우드 예측 및 표현 학습에 어떤 영향을 주는가?
- RQ4지도 우선 정보와 사회적 맥락을 포함할 때 다중 에이전트 운동 예측의 도전 과제와 성능 추세는 어떻게 되는가?
주요 결과
- AV2 Sensor 데이터셋은 훈련/평가를 위한 30개의 분류군과 26개의 잘 샘플링된 카테고리를 가진 1,000개의 장면을 포함한다.
- AV2 Lidar 데이터셋은 10 Hz로 20,000개의 시퀀스를 포함하며 자기지도 학습 및 포인트 클라우드 예측을 지원한다.
- AV2 Motion Forecasting 데이터셋은 다섯 도시를 포함한 여섯 도시에서 흥미로운 상호작용을 위한 시나리오 250,000개를 시나리오별 HD 맵과 함께 채굴했다.
- 3D 물체 탐지 베이스라인(CenterPoint)은 26개 평가 클래스에 대한 대규모 분류체계와 다중 헤드 아키텍처의 유용성을 보여준다.
- 포인트 클라우드 예측은 더 많은 훈련 데이터와 함께 Mean IoU, l1-노름, Chamfer 거리에서 학습 로그가 증가함에 따라 꾸준한 향상을 보인다.
- 운동 예측 베이스라인은 맵 우선 정보와 사회적 맥락의 중요성을 시사하며, 그래프 기반 주의 메커니즘이 높은 예측 시계 간격에서 강력한 성능을 제공한다.
- Baseline 동작 예측 결과는 Argoverse 1.1에 비해 난이도가 증가했음을 시사하며 데이터셋의 롱테일 및 다모드 도전과제를 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.