Skip to main content
QUICK REVIEW

[論文レビュー] Social-VRNN: One-Shot Multi-modal Trajectory Prediction for Interacting Pedestrians

Bruno Brito, Hai Zhu|arXiv (Cornell University)|Oct 18, 2020
Autonomous Vehicle Technology and Safety参考文献 38被引用数 12
ひとこと要約

本稿では、混雑した環境における相互作用する歩行者の1ショット・マルチモーダルな軌道予測のための変分再帰ニューラルネットワーク、Social-VRNNを提案する。変分推論フレームワーク内での時刻依存事前分布を用いて時間的依存性をモデル化することで、1回の順伝播計算で多様で社会的に整合性のある軌道を生成し、GANベースの手法と比較してはるかに少ないサンプル数で、実データおよびシミュレートデータの両方で最先端の性能を達成する。

ABSTRACT

Prediction of human motions is key for safe navigation of autonomous robots among humans. In cluttered environments, several motion hypotheses may exist for a pedestrian, due to its interactions with the environment and other pedestrians. Previous works for estimating multiple motion hypotheses require a large number of samples which limits their applicability in real-time motion planning. In this paper, we present a variational learning approach for interaction-aware and multi-modal trajectory prediction based on deep generative neural networks. Our approach can achieve faster convergence and requires significantly fewer samples comparing to state-of-the-art methods. Experimental results on real and simulation data show that our model can effectively learn to infer different trajectories. We compare our method with three baseline approaches and present performance results demonstrating that our generative model can achieve higher accuracy for trajectory prediction by producing diverse trajectories.

研究の動機と目的

  • 混雑した環境において、不確実で社会的に整合性のある行動を示す歩行者のマルチモーダルで相互作用に配慮した軌道予測の課題に対処すること。
  • 多様な運動仮説を生成するために必要なサンプル数を削減し、自律ロボットナビゲーションにおけるリアルタイム応用を可能にすること。
  • 時間的依存性を潜在空間に時刻依存事前分布でモデル化することで、予測の正確性と多様性を向上させること。
  • 1回のネットワーク推論から複数の妥当な軌道を生成できる生成モデルを開発し、GANベースのアプローチの訓練安定性とサンプル効率の限界を克服すること。
  • 最小限の計算負荷で正確で多様かつ社会的に整合性のある軌道予測を提供することで、リアルタイムの運動計画を可能にすること。

提案手法

  • 本モデルは、潜在変数を用いて歩行者の軌道の連合確率分布をモデル化するため、変分再帰ニューラルネットワーク(VRNN)アーキテクチャを採用する。
  • 時間的依存性を表現するために、潜在空間に時刻依存事前分布を導入し、シーケンスモデリングと軌道の多様性を向上させる。
  • 潜在空間における混合ガウス分布の学習により、マルチモーダルな運動仮説を捉え、1回の順伝播計算で多様な軌道を生成可能にする。
  • 変分推論フレームワークを用いてモデルを最適化し、GANベースの手法と比較して収束が速い。
  • Social-VRNNは、Social-LSTMと同様の社会的プールリング機構を介して相互作用モデリングを統合し、歩行者および障害物間の関係を符号化する。
  • トレーニング戦略は、解釈可能な潜在空間モデリングを通じて、予測軌道の多様性を促進するとともに、高い正確性を維持するように設計されている。

実験結果

リサーチクエスチョン

  • RQ1変分RNNベースのモデルは、1回のネットワーク推論で、相互作用する歩行者の多様でマルチモーダルな軌道を生成できるか?
  • RQ2潜在空間に時刻依存事前分布を導入することで、独立事前分布と比較して、軌道予測性能がどのように向上するか?
  • RQ3提案手法は、GANベースのベースラインと比較して、高品質なマルチモーダル予測に必要なサンプル数をどの程度削減できるか?
  • RQ4本モデルは、静的障害物や複数の歩行者を含む複雑な現実世界のシナリオにも一般化可能か?
  • RQ5本モデルは、1ショット予測を用いて、シミュレート済みデータおよび実世界データの両方で最先端の性能を達成できるか?

主な発見

  • Social-VRNNは、UnivおよびHotelデータセットを含む、シミュレート済みおよび実世界のデータセットで、GANベースのベースラインと比較してはるかに少ないサンプル数で最先端の性能を達成する。
  • 本モデルは、1回の順伝播計算で多様で社会的に整合性のある軌道を生成し、1つのモードしか捉えられない30サンプルを必要とするSocial-Ways GANベースのモデルを上回る。
  • 定性的な結果から、Social-VRNNは環境的・社会的制約に基づき、障害物や他の歩行者を左または右に避けながら進む複数の回避戦略を正しく予測していることが示された。
  • 複数のエージェントと静的障害物を含む複雑なシナリオにおいても、本モデルはすべてのテストケースで正確で多様な予測を維持しており、頑健性を示している。
  • 潜在空間に時刻依存事前分布を導入することで、予測性能が顕著に向上し、時間的ダイナミクスと軌道の多様性のモデリングがより良くなっている。
  • 本モデルは、高品質なマルチモーダル予測に必要なサンプルの複雑さを低減しており、自律ナビゲーションシステムにおけるリアルタイム運動計画に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。