Skip to main content
QUICK REVIEW

[論文レビュー] GD-GAN: Generative Adversarial Networks for Trajectory Prediction and Group Detection in Crowds

Tharindu Fernando, Simon Denman|arXiv (Cornell University)|Dec 18, 2018
Video Surveillance and Tracking Methods参考文献 9被引用数 4
ひとこと要約

本稿では、教師なし深層特徴学習を用いて、群内の歩行者軌跡と社会的グループの両方を同時に予測するGANフレームワーク、GD-GANを提案する。空間的・時間的文脈とスパarsity正則化付きGAN学習を活用することで、手動ラベルなしにタスク固有の表現を学習し、正確で転送可能なグループ検出が可能となり、複数のベンチマークで最先端の手法を上回る性能を発揮する。

ABSTRACT

This paper presents a novel deep learning framework for human trajectory prediction and detecting social group membership in crowds. We introduce a generative adversarial pipeline which preserves the spatio-temporal structure of the pedestrian's neighbourhood, enabling us to extract relevant attributes describing their social identity. We formulate the group detection task as an unsupervised learning problem, obviating the need for supervised learning of group memberships via hand labeled databases, allowing us to directly employ the proposed framework in different surveillance settings. We evaluate the proposed trajectory prediction and group detection frameworks on multiple public benchmarks, and for both tasks the proposed method demonstrates its capability to better anticipate human sociological behaviour compared to the existing state-of-the-art methods.

研究の動機と目的

  • グループメンバーシップの手動ラベル付きデータに依存せずに、群内の社会的グループを検出する課題に対処すること。
  • 社会的アイデンティティと相互作用パターンをエンコードする、豊富でタスク固有の歩行者行動表現を学習すること。
  • 軌跡予測とグループ検出を同時に最適化する統合的なディープラーニングフレームワークを構築すること。
  • 新しいシーンの再訓練を回避することで、異なる監視環境間での直接的な転送性を実現すること。
  • 手作業で設計された特徴量の代わりに、エンドツーエンドで学習された表現を用いて、複雑な人間のナビゲーションをより良くモデル化すること。

提案手法

  • 生成器が将来の軌跡を予測し、識別器が現実的な空間的・時間的パターンを強制するGANベースのアーキテクチャを採用する。
  • 生成器が軌跡予測とグループ検出の両方に関連する特徴を学習できるように、カスタム損失関数を設計する。
  • グループクラスタリングの識別力を向上させるために、生成器の隠れ表現にスパarsity正則化を適用する。
  • 生成器のコンテキスト表現の次元削減にt-SNEを適用し、クラスタリングに適したコンactで意味のある特徴を抽出する。
  • 次元削減された特徴にDBSCANクラスタリングを適用し、教師なしで歩行者グループを検出する。
  • 観測された軌跡を$T_{obs}$から$T_{pred}$の将来ステップまで予測するエンドツーエンドの学習を実施し、生成器の隠れ状態からコンテキスト特徴を抽出する。

実験結果

リサーチクエスチョン

  • RQ1統合的なディープラーニングフレームワークは、群における軌跡予測と教師なしグループ検出を同時に改善できるか?
  • RQ2スパarsity正則化付きGANは、標準の教師ありまたはGANベースの手法よりも、より識別的な歩行者表現を学習できるか?
  • RQ3本手法は、手動ラベル付きグループアノテーションを必要とせずに、最先端のアプローチを上回るグループ検出性能を達成できるか?
  • RQ4学習された特徴は、接近度、整合性、共通の目的といった社会的相互作用パターンをどの程度捉えているか?
  • RQ5再訓練なしに、異なる監視シーン間でのフレームワークの転送性はどの程度高いか?

主な発見

  • 提案されたGD-GANモデルは、CEBベンチマークで79.2%のF1スコア、Student-003で68.4%のF1スコアを達成し、すべてのアブレーションバリアントを上回った。
  • アブレーションスタディの結果、GAN識別器を削除した場合(GD-GAN / GAN)は性能が著しく低下し(適合率73.6%、再現率75.1%)、敵対的学習の必要性が示された。
  • L_1スパarsity正則化を追加することで、標準のcGANベースラインに比べてグループ検出精度が向上し、特徴の識別能向上に寄与することが確認された。
  • GD-GAN特徴と手作業特徴を組み合わせた場合(GD-GAN + hf)に性能向上が顕著でなかったことから、モデルがすでに非常に情報量の多い特徴を学習していることが示された。
  • モデルはリアルタイム推論を達成し、1つのCPUコアで30x2Dポイントを持つ100の軌跡を0.712秒で処理した。時間的効率性が非常に高い。
  • t-SNEプロットの可視化により、同じグループに属する軌跡がより密に埋め込まれていることが確認され、モデルが社会的相互作用パターンを正しくエンコードできていることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。