Skip to main content
QUICK REVIEW

[論文レビュー] Motion Prediction Under Multimodality with Conditional Stochastic Networks

Katerina Fragkiadaki, Jonathan Huang|arXiv (Cornell University)|May 5, 2017
Human Pose and Action Recognition参考文献 36被引用数 13
ひとこと要約

本稿では、スティルな潜在変数の学習されたガウス分布からのサンプリングを通じて、マルチモーダルな運動予測をモデル化する条件付き確率的ニューラルネットワークを提案する。この手法により、多様で高品質な将来の予測が可能になる。本手法は、畳み込みインデックス付きデコーダーや確率的空間トランスフォーマーといった新規アーキテクチャを用いて、不確実性が高まる状況でも、決定論的および変分的ベースラインを上回る性能を発揮する。特に、履歴が短く不確実性が高い状況では、K-bestサンプル損失が優れた性能を示す。

ABSTRACT

Given a visual history, multiple future outcomes for a video scene are equally probable, in other words, the distribution of future outcomes has multiple modes. Multimodality is notoriously hard to handle by standard regressors or classifiers: the former regress to the mean and the latter discretize a continuous high dimensional output space. In this work, we present stochastic neural network architectures that handle such multimodality through stochasticity: future trajectories of objects, body joints or frames are represented as deep, non-linear transformations of random (as opposed to deterministic) variables. Such random variables are sampled from simple Gaussian distributions whose means and variances are parametrized by the output of convolutional encoders over the visual history. We introduce novel convolutional architectures for predicting future body joint trajectories that outperform fully connected alternatives \cite{DBLP:journals/corr/WalkerDGH16}. We introduce stochastic spatial transformers through optical flow warping for predicting future frames, which outperform their deterministic equivalents \cite{DBLP:journals/corr/PatrauceanHC15}. Training stochastic networks involves an intractable marginalization over stochastic variables. We compare various training schemes that handle such marginalization through a) straightforward sampling from the prior, b) conditional variational autoencoders \cite{NIPS2015_5775,DBLP:journals/corr/WalkerDGH16}, and, c) a proposed K-best-sample loss that penalizes the best prediction under a fixed "prediction budget". We show experimental results on object trajectory prediction, human body joint trajectory prediction and video prediction under varying future uncertainty, validating quantitatively and qualitatively our architectural choices and training schemes.

研究の動機と目的

  • 複数の将来の結果が同様に確実である、例えば歩行者や車両の軌道のような状況におけるマルチモーダルな運動予測を扱う。
  • 平均値を予測する決定論的回帰器の限界(複数の可能性を捉えない)や、連続的かつ高次元の空間では失敗する離散的分類器の限界を克服する。
  • 潜在変数における確率的性質を活用して、多様で現実的な将来のサンプルを生成できる、深く微分可能なアーキテクチャを設計する。
  • 直接サンプリング、変分推論、および新規のK-bestサンプル損失といった訓練手法を評価・比較し、確率的ネットワークにおける非可解な周辺化問題に対処する。
  • 入力履歴の長さや不確実性レベルの変化に応じて、物体の軌道、人体関節の動き、動画フレーム予測の3つのタスクにおいて、有効性を実証する。

提案手法

  • 視覚的入力履歴から畳み込みエンコーダーが予測するガウス分布からのスティルな潜在変数をサンプリングする。
  • これらの確率的変数を深く非線形な変換を通じてデコードすることで、マルチモーダルな出力を生成する。
  • 人体関節の動き予測では、畳み込みインデックス付きデコーダーが、完全結合層よりも優れた一般化性能を発揮する。このデコーダーは、デトランスフォーマル特徴マップから関節ごとのピクセル位置の特徴表現を抽出する。
  • 動画予測では、確率的空間トランスフォーマーが、密な光流場を予測し、入力フレームに微分可能な逆ワープを適用することで、将来のフレームを生成する。
  • 3つの訓練手法を評価する:直接事前分布からのサンプリング、条件付き変分オートエンコーダー(近似事後分布を用いる)、および提案されたK-bestサンプル損失(固定予算内で最も良い予測のみにペナルティを課す)。
  • モデルはTensorFlowを用いて、3つのベンチマーク(スタンフォードドローン:物体の軌道、H3.6M:関節の動き、フライブルク・ベルケレーMoSeg:動画フレーム予測)で訓練および評価された。

実験結果

リサーチクエスチョン

  • RQ1確率的ニューラルネットワークは、複数の将来が同様に確実な運動予測タスクにおいて、マルチモーダルな将来の結果を効果的にモデル化できるか?
  • RQ2直接サンプリング、変分推論、K-bestサンプル損失といった異なる訓練手法は、非可解な周辺化問題に対処する確率的ネットワーク最適化において、どのように比較されるか?
  • RQ3提案された畳み込みインデックス付きデコーダーは、完全結合層と比較して、人体関節の動き予測における一般化性能を向上させるか?
  • RQ4光流場ワープを用いた確率的空間トランスフォーマーは、決定論的ベースラインと比較して、より多様で正確な動画予測を生成できるか?
  • RQ5入力履歴長さの変化に伴い、予測性能はどのように変化するか。特に、単一フレーム条件付けにおける高不確実性状況(例:1フレームのみの入力)では?

主な発見

  • K-bestサンプル損失は、直接サンプリングおよび変分オートエンコーダー訓練を上回る性能を示し、特に単一フレーム予測のような高不確実性状況で顕著である。
  • スタンフォードドローンデータセットでは、K-best損失を用いたモデルが、決定論的回帰と比較して顕著に低いトップ1誤差を達成し、変分オートエンコーダーのベースラインと比較してトップ4誤差も低く抑えられている。特に1フレームのみの条件付け時において顕著である。
  • 人体関節の動き予測における畳み込みインデックス付きデコーダーは、完全結合層と比較して、完全畳み込みエンコーダーから得られる空間的に局所化された特徴表現を活用することで、優れた性能を発揮する。
  • H3.6M(カメラが動かない)における動画予測では、確率的空間トランスフォーマーが多様で現実的な将来のフレームを生成するが、カメラの動きを含むMoSegでは、単一フレーム予測は依然として困難であり、カメラの動的要因がモデルに反映されていないためである。
  • 定量的結果から、入力履歴長が延びるにつれて不確実性が低下し、決定論的モデルの性能が向上する傾向にあるが、不確実性が高く曖昧な状況では、確率的モデルが依然として優位性を保っていることが示された。
  • 定性的な結果から、すべてのタスクにおいて多様で現実的なサンプルが得られており、動画生成の結果は著者らのオンラインウェブサイトでアニメーションGIFとして提供されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。