[논문 리뷰] V2X-Seq: A Large-Scale Sequential Dataset for Vehicle-Infrastructure Cooperative Perception and Forecasting
V2X-Seq는 자동주행 차량-인프라 협동(VIC) 인식 및 예측을 위한 첫 번째 대규모 실생활 순차 데이터셋을 소개한다. 인식에는 15,000帧, 예측에는 210,000개의 시나리오가 포함되어 있으며 총 672시간의 데이터를 확보하였다. 본 논문은 VIC3D 추적, 온라인-VIC 예측, 오프라인-VIC 예측의 세 가지 새로운 과제와 벤치마크를 제안하였으며, 인프라 데이터 통합이 추적 및 예측 성능을 향상시킴을 입증하였다. 특히 FF-Tracking은 300ms 지연 조건에서 초기 융합 기반 방법 대비 최대 4%의 MOTA 향상을 달성하였다.
Utilizing infrastructure and vehicle-side information to track and forecast the behaviors of surrounding traffic participants can significantly improve decision-making and safety in autonomous driving. However, the lack of real-world sequential datasets limits research in this area. To address this issue, we introduce V2X-Seq, the first large-scale sequential V2X dataset, which includes data frames, trajectories, vector maps, and traffic lights captured from natural scenery. V2X-Seq comprises two parts: the sequential perception dataset, which includes more than 15,000 frames captured from 95 scenarios, and the trajectory forecasting dataset, which contains about 80,000 infrastructure-view scenarios, 80,000 vehicle-view scenarios, and 50,000 cooperative-view scenarios captured from 28 intersections' areas, covering 672 hours of data. Based on V2X-Seq, we introduce three new tasks for vehicle-infrastructure cooperative (VIC) autonomous driving: VIC3D Tracking, Online-VIC Forecasting, and Offline-VIC Forecasting. We also provide benchmarks for the introduced tasks. Find data, code, and more up-to-date information at \href{https://github.com/AIR-THU/DAIR-V2X-Seq}{https://github.com/AIR-THU/DAIR-V2X-Seq}.
연구 동기 및 목표
- 자율주행 분야에서 차량-인프라 협동(VIC) 인식 및 예측을 위한 실생활 순차 데이터셋의 부족을 해소하기 위해.
- 동기화된 다중 모odal 데이터를 포함한 대규모 실생활 데이터셋을 제공하여 협동 추적 및 행동 예측 연구를 가능하게 하기 위해.
- 차량-인프라 기반 자율주행 시스템의 발전을 위해 VIC3D 추적, 온라인-VIC 예측, 오프라인-VIC 예측의 세 가지 신규 과제를 도입하기 위해.
- 28개 교차로에서 확보한 실생활 데이터를 기반으로 공정한 벤치마크를 설정하여 VIC 인식 및 예측 모델 평가를 가능하게 하기 위해.
- 다양한 지연 조건에서의 추적 강건성을 향상시키는 새로운 FF-Tracking 프레임워크를 개발하고 검증하기 위해.
제안 방법
- 차량 및 인프라 측의 이미지, 포인트 클라우드, 3D 검출 결과, 벡터 지ap, 신호등 상태 정보를 포함한 95개의 실생활 시나리오에서 수집 및 주석 처리된 대규모 순차 V2X 데이터셋(V2X-Seq)을 확보하였다.
- 세 가지 새로운 과제를 설계 및 구현하였다: VIC3D 추적(협동 3D 객체 추적), 온라인-VIC 예측(실시간 인프라 및 자동차 차량 데이터 기반 행동 예측), 오프라인-VIC 예측(과거 인프라 데이터에서의 지식 정제).
- 차량 및 인프라 입력을 특징 수준에서 융합하는 후기 융합 기반 프레임워크인 FF-Tracking을 제안하여 추적 정확도 및 지연 강건성을 향상시켰다.
- PP-VIC를 개발하여 인프라 및 자동차 차량의 궤적을 융합한 후 TNT 및 HiVT와 같은 궤적 모델에 입력함으로써 계층적 인식-예측 프레임워크를 구성하였다.
- 오프라인 예측을 위해 80,000개의 인프라 시야 궤적 데이터로 트레이닝하여 TNT 및 HiVT 모델의 일반화 능력을 향상시켰다.
- 궤적 예측 데이터셋에 대해 5:2:3의 훈련/검증/테스트 분할을 적용하여 모든 기준 모델 및 제안된 방법의 공정한 평가를 확보하였다.

실험 결과
연구 질문
- RQ1인프라 데이터가 협동 인식 시스템 내 3D 객체 추적의 정확도와 강건성에 뚜렷한 향상을 이끌 수 있는가?
- RQ2자신의 차량 데이터 외에 실시간 인프라 궤적 데이터에 접근할 경우, 온라인 궤적 예측 성능이 자동차 차량 전용 모델 대비 얼마나 향상되는가?
- RQ3과거 인프라 궤적 데이터에서 추출한 지식이 오프라인 궤적 예측 성능 향상에 기여하는가?
- RQ4다양한 지연 조건 하에서 제안된 FF-Tracking 프레임워크가 초기 융합 기반 기준 대비 추적 성능에서 어떤 차이를 보이는가?
- RQ5인프라 전용 궤적 데이터로 사전 학습을 수행할 경우, 하류 예측 모델의 일반화 능력 향상에 어떤 영향을 미치는가?
주요 결과
- 300ms 지연 조건에서 FF-Tracking은 초기 융합 기반 방법 대비 최대 4%의 MOTA 향상을 달성하여 통신 지연에 대한 강건성이 뛰어나다는 것을 입증하였다.
- 200ms 지연 조건에서 FF-Tracking은 최고의 추적 성능를 기록하여 실시간 협동 인식에서의 효과성을 확인하였다.
- 온라인 인프라 궤적 데이터를 활용할 경우, TNT 기준 minADE가 3.74, HiVT 기준 0.28 감소하여 실시간 예측에서의 가치를 입증하였다.
- 80,000개의 인프라 시야 궤적 데이터로 사전 학습을 수행한 결과, TNT 기준 minADE가 7.65 감소하고 HiVT 기준 0.03 감소하여 오프라인 지식 추출의 유용성을 입증하였다.
- PP-VIC 프레임워크는 자동차 차량 전용 모델 대비 더 낮은 minADE 및 minFDE 성능을 기록하여 인프라 및 차량 궤적 융합이 예측 정확도 향상에 기여한다는 것을 확인하였다.
- V2X-Seq 데이터셋은 50,000개의 협동 시야 시나리오와 672시간의 데이터를 확보하여 차량-인프라 협동 인식 및 예측에 대한 최초의 대규모 실생활 평가를 가능하게 하였으며, 분야의 새로운 기준을 설정하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.