Skip to main content
QUICK REVIEW

[論文レビュー] Multi-modal anticipation of stochastic trajectories in a dynamic environment with Conditional Variational Autoencoders

Albert Dulian, John C. Murray|arXiv (Cornell University)|Mar 5, 2021
Autonomous Vehicle Technology and Safety参考文献 45被引用数 6
ひとこと要約

本稿では、動的環境におけるマルチモーダルで確率的なトラジェクトリ予測を目的として、キャプセルネットワーク(CapsNet)をバックボーンとする条件付き変分オートエンコーダ(C-VAE)を提案する。過去のエージェントの運動およびラスタライズドされたシーンコンテキストを条件として用いることで、多様で現実的な未来のトラジェクトリを生成し、nuScenes上での最先端手法を上回る性能を示した。minADEおよびminFDEが低く抑えられるとともに、モデルパラメータ数を顕著に削減した。

ABSTRACT

Forecasting short-term motion of nearby vehicles presents an inherently challenging issue as the space of their possible future movements is not strictly limited to a set of single trajectories. Recently proposed techniques that demonstrate plausible results concentrate primarily on forecasting a fixed number of deterministic predictions, or on classifying over a wide variety of trajectories that were previously generated using e.g. dynamic model. This paper focuses on addressing the uncertainty associated with the discussed task by utilising the stochastic nature of generative models in order to produce a diverse set of plausible paths with regards to tracked vehicles. More specifically, we propose to account for the multi-modality of the problem with use of Conditional Variational Autoencoder (C-VAE) conditioned on an agent's past motion as well as a rasterised scene context encoded with Capsule Network (CapsNet). In addition, we demonstrate advantages of employing the Minimum over N (MoN) cost function which measures the distance between ground truth and N generated samples and tries to minimise the loss with respect to the closest sample, effectively leading to more diverse predictions. We examine our network on a publicly available dataset against recent state-of-the-art methods and show that our approach outperforms these techniques in numerous scenarios whilst significantly reducing the number of trainable parameters as well as allowing to sample an arbitrary amount of diverse trajectories.

研究の動機と目的

  • 複雑な都市環境において、未来の経路が不確実で多様な状況下でのマルチモーダルで確率的なトラジェクトリ予測の課題に対処すること。
  • 標準的なCNNの代わりにCapsNetを用いることで、トップダウンのシーンコンテキストをより良い等長性と空間的特徴表現でエンコードし、一般化性能とロバストネスを向上させること。
  • 確率的生成モデルを用いて、決定論的または固定出力の制限を受ける従来手法とは異なり、多数の現実的で多様な未来のトラジェクトリを生成すること。
  • 最小N個のうちの最小値(MoN)損失関数が、予測の多様性を促進し、精度を向上させる効果があるかどうかを評価すること。
  • 性能を維持または向上させつつ、トレーニング可能なパラメータ数を最小限に抑えることで、モデルの複雑さを低減すること。

提案手法

  • モデルは、エージェントの過去の運動およびラスタライズドされたトップダウンのシーン表現を条件として、確率的な未来のトラジェクトリを生成するための条件付き変分オートエンコーダ(C-VAE)を用いる。
  • シーンコンテキストはキャプセルネットワーク(CapsNet)によってエンコードされ、オブジェクトの姿勢やインスタンス化パラメータをモデル化することで、視点変化に対してよりロバストな等長性と空間的構造を持つ特徴を学習する。
  • グローバルおよびローカルの地図表現は幾何的レイヤーに処理され、空間的構造が保持され、エージェントの位置はローカルマップチャンク内に局所化される。
  • モデルは最小N個のうちの最小値(MoN)損失関数を用いて訓練され、真値とN個の生成サンプルのうち最も近いものの距離を最小化することで、予測の多様性を促進する。
  • バックボーンの特徴抽出器は、標準のResNet-50ベースのモデルと比較して、パラメータ数を削減した軽量なCapsNetベースのアーキテクチャである。
  • 推論時、モデルは任意の数の多様なトラジェクトリをサンプリング可能であり、安全性分析やデータ拡張などの柔軟な後続用途に適している。

実験結果

リサーチクエスチョン

  • RQ1キャプセルネットワーク(CapsNet)は、トップダウンのラスタライズドシーンコンテキストを効果的にエンコードでき、一般化性能と空間認識能力において標準CNNを上回るのか?
  • RQ2MoN損失関数を用いた確率的C-VAEフレームワークは、決定論的または固定出力のモデルと比較して、より多様で正確なマルチモーダルトラジェクトリ予測を実現できるのか?
  • RQ3CapsNetベースのバックボーンは、モデルの複雑さを低減しつつ、トラジェクトリ予測ベンチマークで性能を維持または向上できるのか?
  • RQ4サンプリングするトラジェクトリの数が予測精度に与える影響は何か?また、MoN損失関数はさまざまなサンプリングサイズにおいて一貫して性能を向上させるのか?
  • RQ5提案手法は、不確実性が高くマルチモーダル性を示す複雑な都市環境にどの程度一般化可能なのか?

主な発見

  • 128または256個のトラジェクトリをサンプリングした場合、最小平均移動誤差(minADE)が約0.40に達し、優れた予測精度を示した。
  • 200個のトラジェクトリをサンプリングした場合、最小最終移動誤差(minFDE)が約0.17に達し、長期的なトラジェクトリ予測における高い正確性を示した。
  • MTP や CoverNet などの最先端手法と比較して、複数の指標で同等以上または上回り、特に1つ以上のトラジェクトリをサンプリングする際の性能が顕著に優れた。
  • MoN損失関数は多様性と性能を顕著に向上させ、特にサンプリングレートが高め(k > 2^9)の際に最も低い誤差が観測された。
  • ResNet-50ベースのモデルと比較して、CapsNetベースのバックボーンはトレーニング可能なパラメータ数を削減し、過学習の抑制と一般化性能の向上に寄与した。
  • モデルは固定出力数に制限されず、決定論的または固定モードのモデルとは異なり、任意の数の多様で現実的なトラジェクトリを生成可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。