Skip to main content
QUICK REVIEW

[논문 리뷰] MTR++: Multi-Agent Motion Prediction with Symmetric Scene Modeling and Guided Intention Querying

Shaoshuai Shi, Li Jiang|arXiv (Cornell University)|2023. 06. 30.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 대칭적 환경 모델링과 유도된 의도 질의를 활용하여 다중 모드 궤적 예측 성능을 향상시키는 고도화된 다중 에이전트 운동 예측 프레임워크인 MTR++를 제안한다. 학습 가능한 의도 질의를 통해 전반적 의도를 정밀하게 국소화하고, 스택드 트랜스포머 디코더 레이어를 통한 반복적 보정을 통해 MTR의 후속 버전인 MTR에 비해 더 높은 정확도, 빠른 추론 속도, 메모리 효율성을 확보한 MTR++는 WOMD 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Motion prediction is crucial for autonomous driving systems to understand complex driving scenarios and make informed decisions. However, this task is challenging due to the diverse behaviors of traffic participants and complex environmental contexts. In this paper, we propose Motion TRansformer (MTR) frameworks to address these challenges. The initial MTR framework utilizes a transformer encoder-decoder structure with learnable intention queries, enabling efficient and accurate prediction of future trajectories. By customizing intention queries for distinct motion modalities, MTR improves multimodal motion prediction while reducing reliance on dense goal candidates. The framework comprises two essential processes: global intention localization, identifying the agent's intent to enhance overall efficiency, and local movement refinement, adaptively refining predicted trajectories for improved accuracy. Moreover, we introduce an advanced MTR++ framework, extending the capability of MTR to simultaneously predict multimodal motion for multiple agents. MTR++ incorporates symmetric context modeling and mutually-guided intention querying modules to facilitate future behavior interaction among multiple agents, resulting in scene-compliant future trajectories. Extensive experimental results demonstrate that the MTR framework achieves state-of-the-art performance on the highly-competitive motion prediction benchmarks, while the MTR++ framework surpasses its precursor, exhibiting enhanced performance and efficiency in predicting accurate multimodal future trajectories for multiple agents.

연구 동기 및 목표

  • 복잡한 주행 환경에서 다양한 에이전트 행동과 풍부한 환경적 맥락을 고려한 다중 모드 운동 예측의 과제를 해결하기 위해.
  • 궤적 예측에서 고밀도 목표 후보에 대한 의존도를 줄이기 위해, 이는 계산 비용 증가와 학습 불안정성을 유발하기 때문이다.
  • 여러 에이전트에 대해 동시에 다중 모드 궤적을 공동으로, 환경에 부합하는 방식으로 예측할 수 있도록 하기 위해.
  • 의미를 지닌 학습 가능한 명시적 의도 질의를 통해 학습 안정성과 예측 정확도를 향상시키기 위해.
  • 다중 에이전트 운동 예측 시나리오에서 추론 효율성과 메모리 사용량을 향상시키기 위해.

제안 방법

  • MTR++ 프레임워크는 학습 가능한 의도 질의를 갖춘 트랜스포머 인코더-디코더 아키텍처를 채택하여, 서로 다른 운동 모드를 명시적으로 표현함으로써 고밀도 목표 후보에 대한 의존도를 감소시킨다.
  • 전반적 의도 국소화는 이러한 의도 질의의 확률을 사용해 에이전트의 의도를 분류함으로써 달성되며, 이는 효율적인 궤적 예측을 가능하게 한다.
  • 국소적 이동 보정은 상호작용과 상호 에이전트 간의 상호작용을 기반으로 예측 궤적을 반복적으로 개선하는 스택드 트랜스포머 디코더 레이어를 통해 수행된다.
  • 대칭적 환경 맥락 모델링은 각 에이전트의 환경 표현이 에이전트 순서에 대해 불변성을 가지도록 하여 일반화 능력과 상호작용 모델링을 향상시킨다.
  • 상호 유도 의도 질의는 상호 에이전트 어텐션을 가능하게 하여, 에이전트들이 서로의 예측된 행동을 기반으로 자신의 예측 궤적을 보정할 수 있도록 한다.
  • 고밀도 미래 예측 모듈은 맥락 인코더에 고밀도 감독을 제공하고, 잠재적인 미래 궤적을 특징 학습 과정에 통합함으로써 운동 디코딩을 풍부하게 한다.

실험 결과

연구 질문

  • RQ1고밀도 목표 후보에 대한 의존도를 줄이며, 여러 에이전트에 대한 다중 모드 운동 예측을 어떻게 향상시킬 수 있는가?
  • RQ2암묵적인 잠재 임베딩에 비해 명시적이고 학습 가능한 의도 질의가 학습 안정성과 예측 성능에 미치는 영향은 무엇인가?
  • RQ3대칭적 환경 맥락 모델링이 다중 에이전트 운동 예측의 일반화 능력과 정확도를 어떻게 향상시키는가?
  • RQ4서로 유도 의도 질의가 상호 에이전트 상호작용 모델링을 통해 어떻게 환경에 부합하는 궤적 생성을 향상시키는가?
  • RQ5공동 운동 예측에서 성능과 추론 효율성을 균형 잡는 데 최적의 디코더 레이어 수는 얼마인가?

주요 결과

  • MTR++ 프레임워크는 대규모 WOMD 벤치마크에서 MTR 및 이전 방법들을 모두 압도하는 최신 기술 수준(SOTA) 성능을 달성하였으며, minADE, 미스 레이트, mAP 모두에서 승리하였다.
  • 고밀도 미래 예측 모듈을 제거할 경우 mAP가 1.48% 감소하여, 이 모듈이 고밀도 감독 제공 및 맥락 특징 풍부화에 핵심적인 역할을 한다는 점을 입증한다.
  • 디코더 레이어 수를 1에서 6으로 늘일수록 성능 향상이 지속적으로 관찰되었으며, 최적의 성능은 6개 레이어에서 달성되었다. 9개 레이어로 더 늘일 경우 성능 향상이 없었고, 이는 수익 감소 현상을 시사한다.
  • 명시적 의도 질의의 사용은 암묵적인 잠재 임베딩에 비해 수렴 속도가 빠르고 학습 안정성이 향상됨을 보였으며, 특히 질의 수가 증가할수록 두드러진다.
  • 특히 더 많은 수의 에이전트에 대해 궤적을 예측할 경우, MTR에 비해 MTR++는 뛰어난 추론 속도와 메모리 효율성을 확보하였다.
  • MTR++의 mAP 점수는 0.3754에 도달하였으며, minADE는 0.6490, 미스 레이트는 0.1559를 기록하여 이전 접근 방식에 비해 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.