Skip to main content
QUICK REVIEW

[논문 리뷰] VectorFlow: Combining Images and Vectors for Traffic Occupancy and Flow Prediction

Xin Huang, Xiao Yu Tian|arXiv (Cornell University)|2022. 08. 09.
Traffic Prediction and Management Techniques인용 수 6
한 줄 요약

이 논문은 크로스 어텐션 메커니즘을 사용하여 래스터화된 이미지와 벡터화된 궤적/지도 표현을 융합하는 새로운 점유율 및 유량 예측 모델인 VectorFlow를 제안한다. VGG-16과 VectorNet 인코더를 결합하고 다단계 특징 융합을 통해 교착 상태에서의 점유율 및 유량 예측에서 최신 기술 수준의 성능을 달성하였으며, Waymo Open Dataset 챌린지에서 점유율이 차단된 경우의 지표에서 뚜렷한 향상을 보이며 3위를 기록하였다.

ABSTRACT

Predicting future behaviors of road agents is a key task in autonomous driving. While existing models have demonstrated great success in predicting marginal agent future behaviors, it remains a challenge to efficiently predict consistent joint behaviors of multiple agents. Recently, the occupancy flow fields representation was proposed to represent joint future states of road agents through a combination of occupancy grid and flow, which supports efficient and consistent joint predictions. In this work, we propose a novel occupancy flow fields predictor to produce accurate occupancy and flow predictions, by combining the power of an image encoder that learns features from a rasterized traffic image and a vector encoder that captures information of continuous agent trajectories and map states. The two encoded features are fused by multiple attention modules before generating final predictions. Our simple but effective model ranks 3rd place on the Waymo Open Dataset Occupancy and Flow Prediction Challenge, and achieves the best performance in the occluded occupancy and flow prediction task.

연구 동기 및 목표

  • 복잡한 도심 환경에서 다수의 도로 참가자들의 일관된 공동 행동을 효율적으로 예측하는 데 도전한다.
  • 교통 환경의 래스터화된 표현과 벡터화된 표현을 융합하여, 특히 가림을 입은 참가자들에 대한 예측 정확도를 향상시킨다.
  • 참가자 수에 영향을 받지 않는 스파ati오-타임 점유율 유량 필드 예측을 위한 확장 가능하고 효율적인 모델을 개발한다.
  • 자율주행에서 중요하지만 아직 탐색이 부족한 도전 과제인 차단된 점유율 및 유량 예측에서 기존 방법을 능가한다.
  • 이미지 표현과 벡터 표현 간의 크로스 어텐션 융합이 행동 예측에서 효과적인지 입증한다.

제안 방법

  • 모델은 래스터화된 이미지 특징을 위한 VGG-16 인코더와 궤적 및 지도 특징을 위한 VectorNet 인코더를 사용한다.
  • 크로스 어텐션 모듈은 VGG-16의 마지막 두 단계에서 유도된 특징들을 다중 공간 해상도에서 벡터화된 특징과 융합한다.
  • 특징 맵은 공간 해상도를 유지하고 다중 해상도 융합을 가능하게 하기 위해 FPN 방식의 네트워크를 통해 업샘플링된다.
  • 융합된 특징들은 디코더를 위한 128채널 특징 맵을 생성하기 위해 두 개의 3×3 컨볼루션 레이어를 통과한다.
  • 단일 2D 컨볼루션 디코더가 8×4 출력 맵(8개의 웨이포인트 × 4개의 차원: 점유율 및 유량)을 생성한다.
  • 손실 함수는 관측된 점유율과 차단된 점유율에 대해 교차 엔트로피 손실(계수 α=β=1000)과 유량 예측에 대해 L2 손실(γ=1)을 조합한다.

실험 결과

연구 질문

  • RQ1래스터화된 이미지와 벡터화된 궤적/지도 데이터를 융합하면 다수의 도로 참가자들에 대한 공동 행동 예측 성능이 향상되는가?
  • RQ2이미지 표현과 벡터 표현 간의 크로스 어텐션 융합이 차단된 점유율 및 유량 예측 성능 향상에 기여하는가?
  • RQ3제안된 모델은 Waymo Open Dataset에서 확장성과 정확도 측면에서 최신 기술 수준의 방법들과 비교해 어떻게 성능을 내는가?
  • RQ4특징 융합이 특히 차단된 참가자들에 대한 예측 성능 향상에 얼마나 기여하는가?
  • RQ5복잡한 아키텍처 없이도 단순한 엔드 투 엔드 모델이 어텐션 기반 융합을 통해 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • VectorFlow는 Waymo Open Dataset에서 세 가지 지표에서 최고 성능을 기록했다: 차단된 점유율에 대한 AUC와 소프트 IoU, 관측된 점유율에 대한 소프트 IoU.
  • VectorFlow는 Waymo Open Dataset 점유율 및 유량 예측 챌린지에서 총 3위를 기록하였다.
  • 벡터화된 표현을 추가함으로써 VGG 전용 버전 대비 차단된 AUC는 24.46% 향상되고, 차단된 소프트 IoU는 47.06% 향상되었다.
  • VectorFlow는 차단된 점유율에 대해 AUC 0.174와 소프트 IoU 0.045를 기록하여 대부분의 베이스라인을 크게 앞섰다.
  • 유량 예측에 대해 종단 오차(EPE)는 3.603을 기록하여 대부분의 경쟁자들을 능가했으며, Look Around를 제외한 모든 모델을 앞섰다.
  • 아블레이션 연구를 통해 벡터 표현 융합이 특히 도전적인 차단된 상황에서 성능 향상에 핵심적인 역할을 한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.