Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Neural Network for Trajectory Prediction

Nishant Nikhil, Brendan Morris|arXiv (Cornell University)|Sep 3, 2018
Autonomous Vehicle Technology and Safety参考文献 19被引用数 6
ひとこと要約

本論文は、最新のLSTMベースのモデルと同等の精度を達成しながらも、はるかに高速である軽量でエンドツーエンドの畳み込みニューラルネットワーク(CNN)を提案する。マルチアウトプット予測と空間時間的畳み込みを活用することで、並列推論が可能になり、誤差の蓄積が低減され、計算リソースが限られたリアルタイムロボット用途に最適である。

ABSTRACT

Predicting trajectories of pedestrians is quintessential for autonomous robots which share the same environment with humans. In order to effectively and safely interact with humans, trajectory prediction needs to be both precise and computationally efficient. In this work, we propose a convolutional neural network (CNN) based human trajectory prediction approach. Unlike more recent LSTM-based moles which attend sequentially to each frame, our model supports increased parallelism and effective temporal representation. The proposed compact CNN model is faster than the current approaches yet still yields competitive results.

研究の動機と目的

  • リソース制約のあるロボットにおけるリアルタイム配備に適した、計算効率の良い軌道予測モデルの開発。
  • RNN や LSTM が軌道予測に用いられる際の限界、すなわち逐次的推論と勾配消失の問題の解決。
  • 空間時間的相関を活用することで、軌道予測における時系列モデリングに畳み込みネットワークの可能性を検討すること。
  • 社会的またはシーンの文脈に依存せず、単純でコンactなCNNが、複雑で文脈に配慮したLSTMベースのモデルと同等の性能を達成できることを示すこと。
  • マルチステップ出力予測により並列推論を実現し、自己回帰モデルで一般的な誤差伝搬を低減すること。

提案手法

  • 観測された歩行者の軌道から空間時間的特徴を抽出するために、完全畳み込みアーキテクチャに複数の残差ブロックを用いる。
  • 将来の全時間ステップの位置を同時に予測(マルチアウトプット)することで、逐次的依存性を回避し、並列推論を可能にする。
  • 軌道シーケンスを1次元の空間時間的信号として処理し、時間的順序を保ちつつ受容 field の拡大を実現するため、因果的畳み込みを適用する。
  • 推論速度を最適化し、4層の畳み込み層が性能と複雑さのバランスにおいて最良であると判明した。
  • 外部の文脈(例:社会的力、シーン画像など)は使用せず、予測は観測された軌道履歴にのみ依存する。
  • 予測された軌道座標に対して平均二乗誤差損失を用いて、エンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1純粋な畳み込みアーキテクチャが、最先端のLSTMベースのモデルと同等の軌道予測性能を達成できるか?
  • RQ2CNNにおけるマルチアウトプット予測は、自己回帰的シーケンス生成と比較して誤差蓄積をどれほど低減できるか?
  • RQ3単純でコンactなCNNモデルは、より複雑なモデルと比較して推論速度を顕著に向上させつつ、精度を維持できるか?
  • RQ4社会的またはシーンの文脈が欠落している場合、混雑した環境における性能にどのような影響を与えるか?
  • RQ5精度と効率の観点から、軌道予測におけるCNNアーキテクチャの最適な深さは何か?

主な発見

  • 提案されたCNNモデルは、UNIVデータセットにおいて最終平均移動誤差(ADE)0.58、最終移動誤差(FDE)1.20を達成し、S-GAN-Pを上回り、社会的文脈を用いないにもかかわらずSoPhieと同等の性能を示した。
  • S-GAN-Pの33.5倍、S-LSTMの500倍高速であり、推論時間はわずか0.002秒であった。
  • 4層のCNNアーキテクチャが、性能と複雑さのバランスにおいて最良の妥協点を提供しており、5層(深すぎる)または3層(浅すぎる)のネットワークは性能が劣った。
  • マルチアウトプット予測は、逐次的予測と比較して誤差伝搬を顕著に低減しており、定性的な比較でCNNは軌道の安定性を保っている一方、LSTM風のモデルは「曲がり込む」傾向にあることが示された。
  • 混雑した群衆シナリオでは、社会的プーリングが欠落しているため、CNNは誤ったグループ運動予測を回避できており、S-GAN-Pが異なる方向に進む歩行者同士の軌道を誤って統合した事例と対照的であった。
  • シーンや社会的文脈がなくても、多くのシナリオでモデルは頑健に動作したが、文脈が有益であると予想される極めて複雑または曖昧な状況では性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。