[논문 리뷰] Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion
이 논문은 인간 운동의 불확실성을 역방향 확산 과정으로 모델링하는 새로운 확률적 궤적 예측 프레임워크인 Motion Indeterminacy Diffusion (MID)을 제안한다. 이는 가우시안 노이즈 분포에서 시작하여 점차 노이즈를 제거함으로써 다양하고 고품질의 궤적을 생성한다. Transformer 기반 아키텍처를 사용해 조건부 마르코프 체인을 학습함으로써, Stanford Drone 및 ETH/UCY 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, 확산 단계 수를 조절하여 예측의 다양성과 정확성 간에 민감한 제어가 가능하다.
Human behavior has the nature of indeterminacy, which requires the pedestrian trajectory prediction system to model the multi-modality of future motion states. Unlike existing stochastic trajectory prediction methods which usually use a latent variable to represent multi-modality, we explicitly simulate the process of human motion variation from indeterminate to determinate. In this paper, we present a new framework to formulate the trajectory prediction task as a reverse process of motion indeterminacy diffusion (MID), in which we progressively discard indeterminacy from all the walkable areas until reaching the desired trajectory. This process is learned with a parameterized Markov chain conditioned by the observed trajectories. We can adjust the length of the chain to control the degree of indeterminacy and balance the diversity and determinacy of the predictions. Specifically, we encode the history behavior information and the social interactions as a state embedding and devise a Transformer-based diffusion model to capture the temporal dependencies of trajectories. Extensive experiments on the human trajectory prediction benchmarks including the Stanford Drone and ETH/UCY datasets demonstrate the superiority of our method. Code is available at https://github.com/gutianpei/MID.
연구 동기 및 목표
- 궤적 예측에서 다중 모달성과 불확실성을 갖는 인간 운동을 모델링하는 데 도전한다.
- GAN(학습 불안정성)과 CVAE(현실감 없는 샘플) 등의 기존 방법의 한계를 극복하기 위해 운동 불확실성의 변동성을 명시적으로 모델링한다.
- 조절 가능한 확산 과정의 길이를 통해 예측의 다양성과 결정성 간에 민감한 트레이드오프를 가능하게 한다.
- 관측된 행동과 사회적 상호작용을 조건으로 하는 Transformer 기반 아키텍처를 사용해 궤적의 시간적 모델링을 향상시킨다.
제안 방법
- 관측된 궤적을 조건으로 하여 노이즈 분포를 가진 보행 가능한 영역에서부터 점차 불확실성을 제거하는 역방향 확산 과정으로 궤적 예측을 공식화한다.
- 가우시안 전이를 갖는 매개변수화된 마르코프 체인을 사용해 역방향 확산 과정을 모델링하며, 상태 임베딩을 통해 관측된 궤적을 조건으로 한다.
- 공간-시간 그래프 네트워크를 사용해 역행 궤적과 사회적 상호작용을 상태 임베딩으로 인코딩한다.
- 궤적 시퀀스의 장거리 시간적 의존성을 포착하기 위해 Transformer 기반 백본을 활용한다.
- 변분 추론을 사용하고 변분 하한 목적함수를 최적화하여 모델을 훈련시킨다.
- 기본 노이즈 분포에서 점차 노이즈를 제거하는 방식으로 추론 중에 다양한 고품질 궤적을 생성한다.

실험 결과
연구 질문
- RQ1인간 운동에서 높은 불확실성에서 낮은 불확실성으로의 진화를 모델링하면 궤적 예측 품질이 향상되는가?
- RQ2확률적 궤적 예측에서 다양성과 정확성 간에 민감한 트레이드오프를 어떻게 달성할 수 있는가?
- RQ3확산 기반 접근 방식이 GAN 및 CVAE와 같은 기존 생성 모델보다 궤적 예측에서 우월한 성능을 낼 수 있는가?
- RQ4제안된 방법이 보행자 운동의 복잡한 시간적 및 사회적 의존성을 어느 정도 잘 포착하는가?
주요 결과
- MID는 Stanford Drone 및 ETH/UCY 궤적 예측 벤치마크에서 최신 기술 성능(SOTA)을 달성한다.
- 역방향 확산 단계 수를 조절함으로써 다양성과 결정성 간의 제어 가능한 트레이드오프를 가능하게 한다.
- 더 긴 확산 체인을 사용할수록 궤적의 다양성은 감소하고 예측의 결정성이 증가하며, 이는 기대되는 행동과 일치한다.
- 정성적 결과에서는 MID가 생성한 궤적이 장기 예측에서 Trajectron++보다 실제 궤적에 더 가까운 경향을 보였다.
- 노이즈 제거 과정 후에도 보행 가능한 영역 내에서 다양하고 타당한 궤적을 생성하여 현실감 있는 예측을 유지한다.
- 비록 추론 시간이 다소 길어 (ZARA1에서 512개 궤적 기준 17.368초), 하지만 동적 환경에 적합한 고품질이고 현실적인 예측 결과를 제공한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.