Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-modal anticipation of stochastic trajectories in a dynamic environment with Conditional Variational Autoencoders

Albert Dulian, John C. Murray|arXiv (Cornell University)|2021. 03. 05.
Autonomous Vehicle Technology and Safety참고 문헌 45인용 수 6
한 줄 요약

이 논문은 동적 환경에서 다중 모odal, 확률적 궤적 예측을 위해 캡슐 네트워크(CapsNet) 기반의 조건부 변동 자동차오디오 인코더(C-VAE)를 제안한다. 과거의 에이전트 운동과 래스터화된 환경 맵을 조건으로 하여, 다양한 실재성 있는 미래 궤적을 생성하며, nuScenes 데이터셋에서 최신 기술(SOTA)을 초월하여 모델 파라미터를 크게 줄이며 minADE와 minFDE를 낮춘다.

ABSTRACT

Forecasting short-term motion of nearby vehicles presents an inherently challenging issue as the space of their possible future movements is not strictly limited to a set of single trajectories. Recently proposed techniques that demonstrate plausible results concentrate primarily on forecasting a fixed number of deterministic predictions, or on classifying over a wide variety of trajectories that were previously generated using e.g. dynamic model. This paper focuses on addressing the uncertainty associated with the discussed task by utilising the stochastic nature of generative models in order to produce a diverse set of plausible paths with regards to tracked vehicles. More specifically, we propose to account for the multi-modality of the problem with use of Conditional Variational Autoencoder (C-VAE) conditioned on an agent's past motion as well as a rasterised scene context encoded with Capsule Network (CapsNet). In addition, we demonstrate advantages of employing the Minimum over N (MoN) cost function which measures the distance between ground truth and N generated samples and tries to minimise the loss with respect to the closest sample, effectively leading to more diverse predictions. We examine our network on a publicly available dataset against recent state-of-the-art methods and show that our approach outperforms these techniques in numerous scenarios whilst significantly reducing the number of trainable parameters as well as allowing to sample an arbitrary amount of diverse trajectories.

연구 동기 및 목표

  • 복잡한 도심 환경에서 미래 경로가 불확실하고 다양한 경우가 존재하는 상황에서 다중 모달, 확률적 궤적 예측 문제를 해결하기 위해.
  • 표준 CNN 대신 CapsNet을 사용하여 상하좌우 변형에 더 강건하고 공간적 특징 표현이 향상된 맵 컨텍스트를 인코딩함으로써 일반화 능력과 강인성을 향상시키기 위해.
  • 정적 또는 고정 출력 방식의 이전 방법들에서 벗어나, 확률적 생성 모델을 사용하여 다수의 현실적인 미래 궤적을 생성함으로써 다양한 궤적 예측을 가능하게 하기 위해.
  • 최소 N개 중 최소값(MoN) 손실 함수가 다양성 증진과 예측 정확도 향상에 기여하는지 평가하기 위해.
  • 성능을 유지하거나 향상시키면서도 파라미터 수를 줄여 모델 복잡도를 감소시키기 위해.

제안 방법

  • 모델은 에이전트의 과거 운동과 래스터화된 상향 시각화 맵을 조건으로 하여, 조건부 변동 자동차오디오 인코더(C-VAE)를 사용해 확률적 미래 궤적을 생성한다.
  • 환경 맵 컨텍스트는 캡슐 네트워크(CapsNet)로 인코딩되며, 물체의 자세와 인스턴스 파라미터를 모델링하여 동치성 보존 및 공간적으로 구조화된 특징을 학습함으로써 시점 변화에 대한 강인성을 향상시킨다.
  • 전역 및 국소 맵 표현은 공간적 구조를 유지하기 위해 기하학적 레이어로 처리되며, 에이전트의 위치는 국소 맵 조각 내에 국소화된다.
  • 모델는 최소 N개 중 최소값(MoN) 손실 함수를 사용해 훈련되며, 이는 실제 값과 생성된 N개 샘플 중 가장 가까운 것 간의 거리를 최소화함으로써 예측의 다양성을 촉진한다.
  • 백본 특징 추출기는 경량화된 CapsNet 기반 아키텍처로, 표준 ResNet-50 기반 모델 대비 학습 가능한 파라미터 수를 줄였다.
  • 추론 단계에서는 임의의 수의 다양한 궤적을 샘플링할 수 있어, 안전성 분석이나 데이터 증강 등의 후속 응용에 매우 민첩하게 활용 가능하다.

실험 결과

연구 질문

  • RQ1캡슐 네트워크는 상향 래스터화된 환경 맵 컨텍스트를 효과적으로 인코딩할 수 있는가? 일반화 능력과 공간 인식 능력에서 표준 CNN보다 뛰어나다고 할 수 있는가?
  • RQ2MoN 손실 함수를 사용한 확률적 C-VAE 아키텍처가, 정적 또는 고정 출력 모델 대비 더 다양하고 정확한 다중 모달 궤적 예측을 가능하게 하는가?
  • RQ3CapsNet 기반 백본 아키텍처는 모델 복잡도를 줄이면서도 궤적 예측 벤치마크 성능을 유지하거나 향상시킬 수 있는가?
  • RQ4샘플링된 궤적 수가 예측 정확도에 어떤 영향을 미치며, MoN 손실 함수는 다양한 샘플링 크기에서 일관되게 성능 향상을 이끌 수 있는가?
  • RQ5제안된 방법이 높은 불확실성과 다중 모달성을 지닌 복잡한 도심 환경에 얼마나 잘 일반화되는가?

주요 결과

  • 128개 또는 256개의 궤적을 샘플링할 경우, 최소 평균 이격 오차(minADE)가 약 0.40에 도달하여 뛰어난 예측 정확도를 입증한다.
  • 200개의 궤적을 샘플링할 경우 최소 종단 이격 오차(minFDE)가 약 0.17에 도달하여 장기 예측에서 높은 정밀도를 보인다.
  • MTP 및 CoverNet과 같은 최신 기술(SOTA) 방법들과의 비교에서 여러 지표에서 승리하거나 동등한 성능을 보이며, 특히 하나 이상의 궤적을 샘플링할 경우 두드러진 성능 향상을 보인다.
  • MoN 손실 함수는 다양성 향상과 성능 향상에 크게 기여하며, 특히 높은 샘플링 비율(k > 2^9)에서 가장 낮은 오차가 관찰된다.
  • ResNet-50 기반 모델 대비 학습 가능한 파라미터 수가 줄어들어 과적합을 완화하고 일반화 능력을 향상시킨다.
  • 모델은 고정된 출력 수에 제한되지 않아, 정적 또는 고정 모드 모델들과 달리 임의의 수의 다양한 실재성 있는 궤적을 생성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.