[논문 리뷰] Motion Prediction Under Multimodality with Conditional Stochastic Networks
이 논문은 조건부 확률적 신경망을 제안하여, 확률적 잠재 변수에 대한 학습된 정규분포에서 샘플링함으로써 다중모드 운동 예측을 모델링한다. 이는 다양하고 고품질의 미래 예측을 가능하게 한다. 제안된 아키텍처인 컨볼루션 인덱스 기반 디코더와 확률적 공간 트랜스포머를 통해, 특히 높은 불확실성 상황에서 결정론적 및 변분 기반 베이스라인을 능가한다. K-best-sample 손실이 낮은 역사 길이, 높은 불확실성 상황에서 뛰어난 성능을 보였다.
Given a visual history, multiple future outcomes for a video scene are equally probable, in other words, the distribution of future outcomes has multiple modes. Multimodality is notoriously hard to handle by standard regressors or classifiers: the former regress to the mean and the latter discretize a continuous high dimensional output space. In this work, we present stochastic neural network architectures that handle such multimodality through stochasticity: future trajectories of objects, body joints or frames are represented as deep, non-linear transformations of random (as opposed to deterministic) variables. Such random variables are sampled from simple Gaussian distributions whose means and variances are parametrized by the output of convolutional encoders over the visual history. We introduce novel convolutional architectures for predicting future body joint trajectories that outperform fully connected alternatives \cite{DBLP:journals/corr/WalkerDGH16}. We introduce stochastic spatial transformers through optical flow warping for predicting future frames, which outperform their deterministic equivalents \cite{DBLP:journals/corr/PatrauceanHC15}. Training stochastic networks involves an intractable marginalization over stochastic variables. We compare various training schemes that handle such marginalization through a) straightforward sampling from the prior, b) conditional variational autoencoders \cite{NIPS2015_5775,DBLP:journals/corr/WalkerDGH16}, and, c) a proposed K-best-sample loss that penalizes the best prediction under a fixed "prediction budget". We show experimental results on object trajectory prediction, human body joint trajectory prediction and video prediction under varying future uncertainty, validating quantitatively and qualitatively our architectural choices and training schemes.
연구 동기 및 목표
- 다양한 미래 결과가 동일하게 가능할 수 있는 상황, 예를 들어 보행자나 차량의 궤적 예측과 같은 다중모드 운동 예측 문제를 해결하기 위해.
- 평균 결과를 예측하는 결정론적 회귀기의 한계와 연속적이고 고차원 공간에서 실패하는 이산 분류기의 한계를 극복하기 위해.
- 잠재 변수의 확률적 성격을 통해 다양한 가능성이 있는 미래 샘플을 생성할 수 있는 깊이 있는, 미분 가능한 아키텍처를 설계하기 위해.
- 불가항력한 마진나이제이션 문제를 다루기 위해 직접 샘플링, 변분 추론, 그리고 새로운 K-best-sample 손실을 포함한 훈련 방식을 평가하고 비교하기 위해.
- 다양한 불확실성 수준에서 객체 궤적, 인간 신체 관절, 영상 프레임 예측 등 다양한 분야에서 효과성을 입증하기 위해.
제안 방법
- 시각적 입력 역사를 기반으로 컨볼루션 인코더가 예측한 평균과 분산을 갖는 정규분포에서 잠재 변수를 샘플링한다.
- 이러한 확률적 변수들을 깊이 있는 비선형 변환을 통해 디코딩함으로써 다중모드 예측을 생성한다.
- 신체 관절 궤적 예측의 경우, 컨볼루션 인덱스 기반 디코더가 디컨볼루션 특징 맵에서 관절별 픽셀 위치의 특징 임베딩을 추출하여 완전히 연결된 레이어 대비 일반화 성능을 향상시킨다.
- 영상 예측의 경우, 확률적 공간 트랜스포머가 밀도 있는 광학 흐름 필드를 예측하고, 입력 프레임에 대해 미분 가능한 역방향 와핑을 적용하여 미래 프레임을 생성한다.
- 세 가지 훈련 방식을 평가한다: 직접 사전 샘플링, 조건부 변분 오토인코더(근사 사후분포 사용), 그리고 제안된 K-best-sample 손실(고정된 예산 내에서 최상의 예측에만 페널티를 적용함).
- 모델은 텐서플로우를 사용하여 세 가지 벤치마크에서 훈련 및 평가된다: 스탠포드 드론(객체 궤적), H3.6M(신체 관절 궤적), 프라이부르크-베를린 MoSeg(영상 프레임 예측).
실험 결과
연구 질문
- RQ1확률적 신경망은 다중모드 미래 결과가 동일하게 가능할 수 있는 운동 예측 작업에서 효과적으로 다룰 수 있는가?
- RQ2직접 샘플링, 변분 추론, K-best-sample 손실과 같은 다양한 훈련 방식은 불가항력한 마진나이제이션 문제 상황에서 확률적 네트워크 최적화에 대해 어떻게 비교되는가?
- RQ3제안된 컨볼루션 인덱스 기반 디코더 아키텍처는 완전히 연결된 대안 대비 인간 신체 관절 궤적 예측에서 일반화 성능을 향상시키는가?
- RQ4광학 흐름 와핑을 사용하는 확률적 공간 트랜스포머는 결정론적 베이스라인 대비 더 다양한 영상 예측을 생성하는가?
- RQ5입력 역사 길이에 따라 예측 성능은 어떻게 변화하는가? 특히 단일 프레임 조건에서의 높은 불확실성 상황에서 어떻게 되는가?
주요 결과
- K-best-sample 손실은 직접 샘플링과 변분 오토인코더 훈련 방식을 모두 능가하며, 특히 단일 프레임 조건에서 다수의 가능성이 있는 미래가 존재하는 고불확실성 상황에서 뛰어난 성능을 보였다.
- 스탠포드 드론 데이터셋에서 K-best-loss를 사용한 모델은 결정론적 회귀 모델보다 상위-1 오차가 유의미하게 낮았고, 변분 오토인코더 베이스라인보다 상위-4 오차도 낮았다. 특히 단일 프레임 조건에서 두드러진 성능 향상을 보였다.
- 완전히 연결된 레이어 대비 컨볼루션 인덱스 기반 디코더는 완전 컨볼루션 인코더에서 유도된 공간적으로 국소화된 특징 표현을 활용하여 신체 관절 궤적 예측에서 더 뛰어난 성능을 보였다.
- H3.6M(카메라가 움직이지 않는) 영상 예측에서, 확률적 공간 트랜스포머 모델은 다양한 가능성이 있는 미래 프레임을 생성했으며, MoSeg(카메라 운동이 있는)에서는 단일 프레임 예측이 여전히 도전 과제로 남아 있었는데, 이는 카메라 역학을 모델링하지 못했기 때문이다.
- 정량적 결과는 입력 역사 길이가 길어질수록 불확실성이 감소하고 결정론적 모델이 더 경쟁력 있게 되지만, 불확실성이 높고 모호한 상황에서는 여전히 확률적 모델이 우위를 점한다는 것을 보여주었다.
- 정성적 결과는 모든 작업에서 다양한 현실적인 샘플을 생성했으며, 영상 생성 결과는 저자들의 온라인 웹사이트에서 애니메이티드 GIF 형식으로 제공된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.