Skip to main content
QUICK REVIEW

[논문 리뷰] Perceive, Interact, Predict: Learning Dynamic and Static Clues for End-to-End Motion Prediction

Bo Jiang, Shaoyu Chen|arXiv (Cornell University)|2022. 12. 05.
Autonomous Vehicle Technology and Safety인용 수 4
한 줄 요약

이 논문은 인간이 수작업으로 작성한 고해상도 지도나 이력 추적 데이터가 필요 없이 비디오 입력만으로 실시간 맵 작성, 객체 검출, 운동 예측을 동시에 수행하는 엔드 투 엔드 Transformer 기반 프레임워크인 PIP을 제안한다. 지도, 에이전트, 모드 쿼리를 사용하고 다양한 작업 간 상호작용을 유도하는 미분 가능한 다중 작업 설계를 통해 PIP는 0.258 EPA의 최고 성능을 기록하며, 추적 기반 및 고해상도 지도 기반 방법들을 모두 능가한다.

ABSTRACT

Motion prediction is highly relevant to the perception of dynamic objects and static map elements in the scenarios of autonomous driving. In this work, we propose PIP, the first end-to-end Transformer-based framework which jointly and interactively performs online mapping, object detection and motion prediction. PIP leverages map queries, agent queries and mode queries to encode the instance-wise information of map elements, agents and motion intentions, respectively. Based on the unified query representation, a differentiable multi-task interaction scheme is proposed to exploit the correlation between perception and prediction. Even without human-annotated HD map or agent's historical tracking trajectory as guidance information, PIP realizes end-to-end multi-agent motion prediction and achieves better performance than tracking-based and HD-map-based methods. PIP provides comprehensive high-level information of the driving scene (vectorized static map and dynamic objects with motion information), and contributes to the downstream planning and control. Code and models will be released for facilitating further research.

연구 동기 및 목표

  • 비용이 많이 들거나 정적 또는 오래된 지도 데이터에 의존하는 고해상도 지도 기반 및 추적 기반 운동 예측 방법의 한계를 해결하기 위해.
  • 사람이 수작업으로 작성한 고해상도 지도나 이력 상황의 에이전트 궤적을 요구하지 않고도 비디오 입력에서 직접 엔드 투 엔드 학습을 통해 운동 예측을 수행하기 위해.
  • 동적 에이전트, 정적 지도 요소, 운동 의도 간의 상호작용을 모델링하는 통합 쿼리 기반 프레임워크를 통해 인식과 예측을 동시에 최적화하기 위해.
  • 인식과 예측 간 상관관계를 활용해 정확도를 향상시키기 위한 완전히 미분 가능한 다중 작업 상호작용 메커니즘을 개발하기 위해.

제안 방법

  • PIP는 정적 지도 요소, 동적 에이전트, 운동 의도를 각각 인스턴스 수준의 표현으로 인코딩하기 위해 지도 쿼리, 에이전트 쿼리, 모드 쿼리의 세 가지 유형의 쿼리를 사용한다.
  • 움직임 상호작용 모듈은 에이전트 중심 표현과 지도 특징 간의 명시적 및 암시적 상호작용을 가능하게 하며, 어텐션 메커니즘을 사용해 지도 맥락과 에이전트 상태를 융합한다.
  • 예측의 분산을 줄이기 위해 에이전트 중심 좌표계로의 전환을 통해 에이전트별 정규화를 수행한다.
  • 에이전트와의 공간적 근접성과 신뢰도 점수를 기반으로 지도 특징을 필터링하여 예측에 관련된 지도 맥락만 사용한다.
  • 감지, 맵 작성, 운동 예측 목표를 결합한 다중 작업 손실을 사용해 엔드 투 엔드로 학습하며, 학습 가능한 손실 가중치를 적용한다.
  • 더 나은 운동-지도 상호작용을 위해 지도 특징을 인스턴스 수준 표현으로 추가로 인코딩하기 위해 VectorNet을 사용한다.

실험 결과

연구 질문

  • RQ1사전에 제작된 고해상도 지도에 의존하지 않고 원시 비디오에서 실시간 맵 작성, 객체 검출, 운동 예측을 동시에 학습할 수 있는 엔드 투 엔드 프레임워크는 가능한가?
  • RQ2통합 쿼리 기반 Transformer 아키텍처에서 인식과 예측 간 효과적인 상관관계를 유도하기 위해 어떻게 다중 작업 상호작용 메커니즘을 미분 가능하게 설계할 수 있는가?
  • RQ3비디오 입력만으로도 고해상도 지도나 이력 추적 데이터를 사용하는 방법과 비교해 운동 예측 성능을 유사하거나 뛰어나게 달성할 수 있는가?
  • RQ4명시적 및 암시적 지도-에이전트 상호작용은 궤적 예측 정확도와 다양성에 어떤 영향을 미치는가?

주요 결과

  • PIP는 0.258 EPA를 기록하여 이전의 최고 성능 방법 [11]을 초월하며, 고해상도 지도나 추적 데이터 없이도 뛰어난 운동 예측 성능를 입증한다.
  • 이전 SOTA 대비 minADE를 0.91m 감소시키고 minFDE를 1.17m 감소시켜 궤적 정확도 향상이 뚜렷하게 나타난다.
  • 예측된 벡터화된 지도를 사용할 경우 실제 고해상도 지도를 사용한 성능과 거의 유사하며, minADE에서 뿐다 0.01m의 격차만 존재해 지도 예측 오차에 대해 뛰어난 내성성을 보인다.
  • 절단 실험 결과 다중 작업 상호작용 설계의 효과성을 확인하였으며, 특히 에이전트별 정규화와 신뢰도 기반 지도 필터링이 유의미한 기여를 한다.
  • 정성적 결과에서는 PIP가 의미 있는 에이전트-지도 상관관계를 학습하고, 특히 합류 차량의 경우 다양하고 현실적인 다중 모달 예측을 생성함을 보여준다.
  • 프레임워크는 종단 간 계획 및 제어에 유용한 고수준 시나리오 표현—벡터화된 지도와 운동 인식 기반 객체 검출—을 출력한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.