[논문 리뷰] Motion Transformer with Global Intention Localization and Local Movement Refinement
논문은 전역 의도를 로컬로 정제하고 작은 수의 학습 가능한 모션 쿼리 쌍을 사용하여 세계적 모션 의도를 로컬 움직임으로 정밀하게 찾는 트랜스포머 기반의 멀티모달 모션 예측 프레임워크인 Motion TRansformer(MTR)을 소개합니다. Dense goal 후보군 없이도 Waymo Open Motion Dataset에서 최첨단 성능을 달성합니다.
Predicting multimodal future behavior of traffic participants is essential for robotic vehicles to make safe decisions. Existing works explore to directly predict future trajectories based on latent features or utilize dense goal candidates to identify agent's destinations, where the former strategy converges slowly since all motion modes are derived from the same feature while the latter strategy has efficiency issue since its performance highly relies on the density of goal candidates. In this paper, we propose Motion TRansformer (MTR) framework that models motion prediction as the joint optimization of global intention localization and local movement refinement. Instead of using goal candidates, MTR incorporates spatial intention priors by adopting a small set of learnable motion query pairs. Each motion query pair takes charge of trajectory prediction and refinement for a specific motion mode, which stabilizes the training process and facilitates better multimodal predictions. Experiments show that MTR achieves state-of-the-art performance on both the marginal and joint motion prediction challenges, ranking 1st on the leaderboards of Waymo Open Motion Dataset. The source code is available at https://github.com/sshaoshuai/MTR.
연구 동기 및 목표
- 자율 주행에서 밀집한 목표 후보 없이도 강력한 멀티모달 모션 예측을 위해 견고함을 모티브로 삼습니다.
- 전역 의도 로컬라이제이션과 로컬 이동 정제를 모션 쿼리 쌍으로 결합하는 단일 프레임워크를 제안합니다.
- Auxiliary한 Dense Future 예측 작업을 도입하여 미래 상호작용 맥락을 풍부하게 만듭니다.
- WOMD의 여백 모션 및 결합 모션 벤치마드에서 최첨단 성능을 입증합니다.
제안 방법
- 전역 로컬라이제이션을 위한 정적 의도 쿼리와 로컬 정제를 위한 동적 탐색 쿼리로 구성된 모션 쿼리 쌍을 도입합니다.
- 에이전트 이력과 도로 맵에서의 로컬 자기-주의를 사용하는 트랜스포머 인코더로 장면 맥락을 인코딩합니다.
- 모든 에이전트의 미래 궤적과 속도를 예측하는 Dense Future 예측 보조 작업을 맥락으로 추가합니다.
- 각 모션 모드에 대해 궤적에 정렬된 맵 특징을 수집하는 동적 맵 수집 모듈을 구현합니다.
- 다모드 미래 분포를 표현하기 위해 가우시안 혼합 모델 헤드를 적용하고 학습 시 하드 어싸인먼트를 사용합니다.
- 보조 L1 손실과 디코더 층의 음의 로그 가능도 손실을 함께 최적화하는 엔드-투-엔드 학습을 수행합니다.
실험 결과
연구 질문
- RQ1학습 가능한 소량의 모션 쿼리 쌍이 Dense 목표 후보 없이 멀티모달 미래 모션을 효과적으로 포괄할 수 있는가요?
- RQ2전역 의도 로컬라이제이션과 로컬 이동 정제는 예측의 안정성과 정확도를 개선하나요?
- RQ3Dense Future 예측 작업을 도입하면 장면 일관성 있는 궤적 생성을 개선하나요?
- RQ4인코더의 로컬 자기-주의가 큰 맵 맥락에서 맥락 모델링과 메모리 효율성에 어떤 영향을 미치나요?
주요 결과
- MTR은 WOMD의 여백 모션 예측에서 최첨단 성능을 달성하며, 앙상블 없이도 베이스라인 대비 mAP에서 유의한 향상을 보였습니다.
- MTR은 결합 모션 예측 벤치마크에서도 이전 방법보다 우수한 성능을 보이며 더 높은 mAP와 낮은 누락률을 달성했습니다.
- 의도 포인트가 있는 정적 의도 쿼리는 잠재 학습 임베딩에 비해 상당한 mAP 향상을 제공하며 모드별 쿼리의 이점을 강조합니다.
- Dense Future 예측 모듈은 미래 궤적 간의 상호 작용을 포착하여 궤적 품질을 크게 향상시킵니다.
- 로컬 자기-주의는 대형 맵 맥 context에서 글로벌 주의보다 성능 및 메모리 효율성을 향상시킵니다.
- Ensemble 변형 및 엔드-투-엔드 MTR-e2e는 강력한 성능을 보이며 MTR-Advanced-ens가 테스트 세트에서 최상위 순위를 차지합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.